Design a Video Generation Service with GPU Fleet Management
Company: OpenAI
Role: Software Engineer
Category: ML System Design
Difficulty: medium
Interview Round: Technical Screen
Overview: Design an asynchronous video generation service centered on GPU fleet scheduling. Define durable job states, model and artifact versions, resource-aware placement, leases, checkpointing, autoscaling, moderation, bounded retries, cancellation, idempotent publication, and cost controls.