제목
AI 영상 파이프라인을 한 트랜잭션으로 묶었다가 비용으로 배운 것들
본문
사내에서 크리에이터용 영상 자동 생성 툴을 만들고 있습니다. 초기 구조는 단순했어요. 요청 들어오면 워커가 대본 생성(LLM) → TTS → 렌더링을 순서대로 처리하고 끝. 로컬에선 잘 돌았습니다.
문제는 렌더링 단계였습니다. 인코딩에서 실패하면 앞단에서 이미 태운 LLM·TTS 호출까지 통째로 날아갔습니다. 재시도하면 같은 대본을 다시 생성하니 비용은 두 배, 결과물은 매번 미묘하게 달랐고요. 결국 각 단계를 분리해서 중간 산출물을 스토리지에 남기고 job 상태를 명시적으로 관리하는 구조로 갈아엎었습니다. 실패한 지점부터 재개되니 재시도 비용이 확 줄었습니다.
두 번째는 큐 기아 현상이었습니다. 한 계정이 배치로 50건을