← 포트폴리오 목록

PDF 영상 자동 생성 스튜디오

전문 문서 PDF 한 건을 업로드하면 AI가 내용을 분석해 대본과 스토리보드를 구성하고, 이미지·영상 생성 AI와 TTS를 연동해 씬별로 자동 합성한 MP4 영상을 출력하는 AI 기반 영상 자동화 스튜디오를 구현합니다.

6단계 생성 파이프라인 상태머신 설계파싱부터 렌더링까지 6단계를 상태 테이블로 모델링하고, 단계별 실패·재시도 로직을 카드 UI에 반영하는 구조를 구현합니다.
멀티 LLM 환각 최소화 검증 로직 구현GPT·Claude·Gemini 응답을 원문 근거와 대조해 정확성을 우선하는 교차 검증 로직을 설계하고, 근거 부족 구간은 재생성 큐로 전달합니다.
프롬프트 버전 관리 시스템 구축프롬프트·생성 규칙을 이력 테이블로 관리해 코드 배포 없이 즉시 반영·롤백 가능한 구조를 설계합니다.
서비스 타입Web
업종데이터 분석
기술 스택
React 18 + TypeScriptTailwind CSSPython + FastAPIPostgreSQL + SQLAlchemyOpenAI GPT API / Anthropic Claude API / Google Gemini APIVeo API / Kling API / Runway APIFFmpeg + Remotion 렌더링 파이프라인Redis + Celery (비동기 파이프라인 작업 큐)AWS S3 (생성 에셋 스토리지)
주요 기능
  • 생성 파이프라인 진행 보드
  • PDF 업로드 및 생성 옵션 설정
  • 프롬프트·생성 규칙 관리 에디터
  • AI 에셋 생성 및 미디어 합성 미리보기
Overview

프로젝트 개요

범위: 개발, 디자인, 기획
전문 문서 PDF 한 건을 업로드하면 AI가 내용을 분석해 대본과 스토리보드를 구성하고, 이미지·영상 생성 AI와 TTS를 연동해 씬별로 자동 합성한 MP4 영상을 출력하는 AI 기반 영상 자동화 스튜디오를 구현합니다. 업로드부터 렌더링까지 각 단계의 진행 상태를 칸반 보드 형태로 시각화하고, 프롬프트와 생성 규칙을 코드 수정 없이 직접 관리할 수 있는 구조로 설계합니다.
PDF 영상 자동 생성 스튜디오
요구사항 정의

프로젝트 핵심 과제

프로젝트 진행 시 해결한 핵심 기술 과제입니다.

PDF 문서마다 상이한 레이아웃·표·이미지 구조에서 핵심 내용을 안정적으로 추출하는 파싱 전략 설계

멀티 LLM 응답의 환각(hallucination)을 원문 근거와 교차 검증해 걸러내는 로직 설계

Veo/Kling/Runway 등 이기종 영상 생성 API의 응답 지연·실패 편차를 흡수하는 재시도·타임아웃 전략

씬별 이미지·영상·TTS·자막의 길이를 동기화해 어색한 컷 전환 없이 합성하는 타이밍 로직 설계

구현 내용

핵심 기능 상세

핵심 기능 1

생성 파이프라인 진행 보드

업로드된 문서 한 건이 파싱→AI 분석→대본/스토리보드 생성→이미지 생성→영상 생성→TTS·자막 합성 렌더링 단계를 거치는 과정을 칸반 보드 형태로 보여주어
생성 파이프라인 진행 보드
핵심 기능 2

PDF 업로드 및 생성 옵션 설정

전문 PDF 문서 한 건을 드래그 앤 드롭으로 업로드하고, General/Expert 난이도 수준과 20초·30초·60초 영상 길이를 선택할 수 있는 업로드 화면을 구현합니다
PDF 업로드 및 생성 옵션 설정
핵심 기능 3

프롬프트·생성 규칙 관리 에디터

대본 생성, 스토리보드 구성, 이미지·영상 프롬프트에 사용되는 템플릿과 생성 규칙을 코드 수정 없이 화면에서 직접 추가·수정할 수 있는 관리 에디터를 구현합니다
프롬프트·생성 규칙 관리 에디터
핵심 기능 4

AI 에셋 생성 및 미디어 합성 미리보기

씬별로 생성된 이미지·영상·TTS 음성·자막을 미리보기로 확인하고, 특정 씬만 선택해 재생성하거나 최종 합성된 MP4를 다운로드할 수 있는 화면을 구현합니다
AI 에셋 생성 및 미디어 합성 미리보기
구현 과정

프로젝트 진행 단계

STEP 1

PDF 파싱 및 파이프라인 Job 스키마 설계

PDF 텍스트/구조 파싱 로직 구현, 파이프라인 6단계 Job·로그 테이블 설계

STEP 2

LLM 분석 및 대본·스토리보드 생성 엔진 개발

GPT/Claude/Gemini API 연동 문서 분석, 환각 검증 로직을 포함한 대본 생성 엔진 구현

STEP 3

이미지·영상·TTS 생성 AI 연동

Veo/Kling/Runway·이미지 생성·TTS API 어댑터 계층 구현, 씬별 요청 큐 설계

STEP 4

FFmpeg/Remotion 합성 렌더링 및 보드 UI 개발

씬별 미디어 동기화 합성 파이프라인 구현, 칸반 보드·프롬프트 에디터 UI 개발

프로젝트 성과

주요 성과

6단계 생성 파이프라인 상태머신 설계파싱부터 렌더링까지 6단계를 상태 테이블로 모델링하고, 단계별 실패·재시도 로직을 카드 UI에 반영하는 구조를 구현합니다.
멀티 LLM 환각 최소화 검증 로직 구현GPT·Claude·Gemini 응답을 원문 근거와 대조해 정확성을 우선하는 교차 검증 로직을 설계하고, 근거 부족 구간은 재생성 큐로 전달합니다.
프롬프트 버전 관리 시스템 구축프롬프트·생성 규칙을 이력 테이블로 관리해 코드 배포 없이 즉시 반영·롤백 가능한 구조를 설계합니다.
영상 생성 AI 어댑터 계층 설계Veo/Kling/Runway 등 이기종 API 응답을 공통 스키마로 정규화하는 어댑터 패턴을 구현합니다.
Highlights

기술적 주안점

  • 6단계 파이프라인 상태를 칸반 보드로 시각화하고, 단계별 실패 시 재시도 횟수와 사유를 카드 배지로 표시하는 구조를 구현합니다
  • 업로드 시점에 문서 유효성을 사전 검증해 파이프라인 진입 전에 처리 불가 문서를 걸러내는 구조를 구현합니다
  • 프롬프트/규칙 변경이 즉시 다음 생성 요청부터 반영되는 구조를 구현해, 코드 배포 없이 결과물 톤을 조정할 수 있게 설계합니다

유사한 프로젝트를 기획하고 계신가요?

FIRSTPIP이 개발 범위와 로드맵을 함께 정리해드립니다

무료 상담 시작하기