1920×1088의 비밀: 중국 AI 영상 제작팀의 첫 프레임 계승 문법과 2층 네거티브 설계 (무성 다큐 프롬프트 전문 해부)
80부작 숏드라마 팀에 이어 발견된 세 번째 중국 제작팀의 15초 무성 다큐 프롬프트를 역분석했습니다. 1088 해상도를 택한 제작팀의 경험적 가설, 첫 프레임 고정 항목 7개를 네 곳에 반복하는 계승 문법, 소재 편향을 특정한 2층 네거티브와 오디오 블록을 정리했습니다.
- 1920×1088은 H.264의 16×16 매크로블록 관행에서 착안한 제작팀의 경험적 규칙입니다. 공식 Seedance 보장값은 아니므로 동일 입력으로 A/B 테스트해야 합니다.
- "첫 프레임을 유지하라"는 한 문장으로는 걸리지 않습니다. 고정 항목을 7개로 열거하고 같은 선언을 프롬프트 안 네 지점에 반복하는 것이 실제 계승 문법입니다.
- 네거티브가 전체 분량의 4분의 1입니다. 넓게 한 번 거는 카테고리 네거티브와, 소재 자체가 부르는 편향을 특정해 7번 반복하는 편향 네거티브의 2층 구조입니다.

목차
- 초보자를 위한 핵심 용어 사전
- 이 글을 읽기 전에
- 세 번째 팀: 대사도 캐릭터도 없는 15초
- 기법 1: 1920×1088 — 인코더의 관점에서 쓴 한 줄
- 기법 2: 첫 프레임 계승 문법 — 7항목 열거와 4회 반복
- 기법 3: 네거티브 2층 구조 — 카테고리와 편향
- 기법 4: 오디오는 금지와 허용을 함께 쓴다
- 기법 5: 도메인 지식을 프롬프트에 박아 넣는다
- 전체 구조: 드라마팀의 8블록 vs 다큐팀의 5블록
- 실전 템플릿: I2V 첫 프레임 계승형
- 무엇을 언제 쓸 것인가
- 정리
초보자를 위한 핵심 용어 사전
- I2V(Image-to-Video): 이미지 한 장을 출발점으로 삼아 움직이는 영상을 만드는 방식입니다.
- 첫 프레임 락: 시작 이미지의 구도·주체 위치·색조·광선 같은 조건을 영상 첫 장면에 최대한 유지시키는 프롬프트 설계입니다.
- 매크로블록: 전통적인 영상 코덱이 화면을 압축할 때 사용하는 블록 단위입니다. H.264 문맥에서는 16×16 단위가 핵심이지만, 표시 해상도와 내부 부호화 크기는 다를 수 있습니다.
- 네거티브 프롬프트: 자막, 워터마크, 원치 않는 전투처럼 생성 결과에서 배제할 요소를 적는 지시입니다.
- 편향 네거티브: 모든 영상에 공통인 금지 목록이 아니라, 특정 소재가 반복해서 불러오는 오류만 겨냥한 금지 지시입니다.
이 글을 읽기 전에
이 포스트는 중국 AI 숏드라마 공장의 프롬프트 엔지니어링 해부: 1-Shot 90% 일관성 달성 비법과 실전 템플릿의 후속편입니다.
앞선 글에서는 중국 전문 제작팀 두 곳이 80부작 이상의 상업용 AI 숏드라마를 양산하며 쓰던 프롬프트를 역분석해, 컷 분할형(트랙 A)과 연속 촬영형(트랙 B) 두 파이프라인과 8대 기법을 정리했습니다. 얼굴 마스킹, 조명 상대 비율, 컷별 네거티브 리셋, 다음 화 첫 대사 인계 같은 것들이었습니다.
그리고 하루 뒤, 세 번째 팀의 프롬프트 전문이 같은 경로로 공개되었습니다.
그런데 이 프롬프트는 앞의 두 팀과 결이 완전히 다릅니다. 대사가 없고, 캐릭터 참조 태그가 없고, 컷 분할도 없습니다. 앞선 글에서 정리한 8대 기법 중 절반이 아예 등장하지 않습니다.
대신 앞의 두 팀이 전혀 신경 쓰지 않던 것에 프롬프트 분량의 상당 부분을 씁니다. 그중 하나는 스레드 작성자가 “핵심”이라고 따로 지목한 숫자 하나입니다.
앞선 글을 읽지 않으셔도 이 글은 독립적으로 읽힙니다. 다만 “왜 이 팀은 저 팀과 다르게 하는가”라는 비교가 이 글의 뼈대이므로, 8블록 문법의 배경이 궁금하시면 앞선 글을 먼저 보시는 편이 이해가 빠릅니다.
세 번째 팀: 대사도 캐릭터도 없는 15초
공개된 프롬프트의 소재는 이렇습니다.
- 길이: 15초, 원테이크(컷 전환 없음)
- 내용: 현대의 새치(旗鱼, 돛새치)가 3억 8천만 년 전 데본기 얕은 바다에 놓인 초실사 고생물 다큐멘터리
- 유통: 콰이쇼우(快手) 등 중국 숏폼 플랫폼
- 모델: Seedance (즉몽/드림이나)
- 입력 방식: I2V — 참조용 첫 프레임 이미지 한 장에서 출발
2026년 7월 31일 공개된 최신 Seedance 2.5는 한 번에 최대 30초 생성과 다중 연장을 공식 지원합니다. 다만 이 글이 분석하는 것은 특정 제작팀이 공개한 프롬프트 운용법이며, 공식 모델 사양이나 성공 보장 공식이 아닙니다.
“현대 생물 vs 고대 생물”은 중국 숏폼에서 조회수가 잘 나오는 정형 포맷입니다. 상어를 백악기에, 범고래를 오르도비스기에 던져 넣는 식으로 소재만 갈아 끼우며 양산합니다. 즉 이것 역시 한 편짜리 창작물이 아니라 공정입니다.
드라마팀과 다큐팀의 조건 차이를 먼저 정리하면 이후 내용이 전부 설명됩니다.
| 드라마팀 (앞선 글) | 다큐팀 (이번 글) | |
|---|---|---|
| 주체 | 사람 여러 명 | 생물 한 마리 |
| 대사 | 있음 (립싱크·더빙 지시 필수) | 없음 (완전 무성) |
| 컷 | 3–5컷 분할 또는 구간 전환 | 원테이크 1컷 |
| 정체성 고정 | 캐릭터 시트 + @태그 바인딩 |
참조 첫 프레임 이미지 1장 |
| 연속성 대상 | 얼굴·의상·헤어 | 첫 프레임 구도·색조·광선 |
| 최대 리스크 | 인물이 다른 사람이 됨 | 모델이 사냥·전투를 지어냄 |
| 프롬프트 예산 최다 | 광영 설계 + 더빙 지시 | 네거티브 (약 1/4) |
캐릭터가 없으니 @태그 바인딩이 통째로 사라지고, 그 자리를 첫 프레임 락이 대신합니다. 대사가 없으니 더빙 상수·변수 카드가 사라지고, 그 자리를 오디오 요구 블록이 대신합니다. 블록이 없어진 게 아니라 역할이 이동한 것입니다.
기법 1: 1920×1088 — 인코더의 관점에서 쓴 한 줄
프롬프트의 첫 줄입니다.
时长 15 秒,画幅 16:9,1920×1088。
(길이 15초, 화면비 16:9, 1920×1088)
1080이 아니라 1088입니다. 오타가 아니고, 이 팀이 매번 쓰는 값입니다.
왜 16의 배수인가
H.264를 비롯한 전통 비디오 코덱은 화면을 16×16 픽셀의 매크로블록(macroblock) 으로 잘라서 압축합니다. 그래서 가로세로가 16으로 나누어떨어지지 않으면 코덱이 가장자리를 임의로 패딩해야 합니다.
- 1920 ÷ 16 = 120 → 딱 떨어짐
- 1088 ÷ 16 = 68 → 딱 떨어짐
- 1080 ÷ 16 = 67.5 → 안 떨어짐
전통적인 H.264 파이프라인에서는 1920×1080 표시 영상을 내부적으로 1920×1088 크기에 맞춘 뒤 크롭 정보를 사용한 사례가 있습니다. 다만 모든 1080p 스트림이 반드시 이 방식으로 저장되는 것은 아니며, 최신 코덱·인코더·AI 모델은 서로 다른 정렬 단위를 사용할 수 있습니다.
왜 그게 프롬프트에 필요한가
여기서부터가 실무입니다. I2V 파이프라인은 이렇게 흘러갑니다.
[레퍼런스 이미지 생성] → [크롭] → [영상 생성] → [크롭] → [최종 인코딩]
각 단계가 자기 편한 규격으로 반올림하고 잘라냅니다. 한 단계에서는 1–2픽셀 수준이라 눈에 보이지 않습니다. 그런데 다섯 단계를 지나며 어긋남이 누적되면, 첫 프레임이 레퍼런스 이미지와 미묘하게 다른 화각이 됩니다.
“마지막 프레임을 캡처해서 다음 영상의 첫 프레임으로 넣었는데 이어 붙이면 살짝 튄다”
이런 규격 변환은 첫 프레임 불일치의 원인 후보가 될 수 있습니다. 그러나 공개된 공식 Seedance 문서는 1920×1088이 I2V 정합성을 보장한다고 설명하지 않으므로, 모델 성능·리사이즈 방식·생성 변동성과 분리해 A/B 테스트해야 합니다.
이 팀은 그래서 파이프라인 전 구간을 16의 배수로 통일했습니다. 기술 표준에서 직접 도출된 필수값이라기보다, 변환 단계를 줄이기 위한 해당 팀의 경험적 운용 규칙으로 보는 편이 정확합니다.
화면비별 권장 해상도
| 화면비 | 16의 배수 해상도 | 용도 |
|---|---|---|
| 16:9 | 1920×1088 | 유튜브 가로, 일반 영상 |
| 16:9 (저해상) | 1280×720 | 초안·테스트 (720은 16의 배수) |
| 9:16 | 1088×1920 | 숏폼 세로 |
| 1:1 | 1088×1088 | 피드 정사각 |
| 4:3 | 1024×768 | 레트로·아카이브 룩 |
주의할 점이 하나 있습니다. 레퍼런스 이미지도 반드시 같은 규격으로 만들어야 합니다. 이미지가 1080×1920인데 영상만 1088×1920으로 선언하면, 없던 어긋남을 오히려 만들어냅니다. 파이프라인 전체를 통일하는 것이 요점이지, 1088이라는 숫자에 마법이 있는 게 아닙니다.
기법 2: 첫 프레임 계승 문법 — 7항목 열거와 4회 반복
해상도 락이 절반이라면, 나머지 절반이 이것입니다. 프롬프트 첫 줄이 해상도 다음에 바로 이어집니다.
必须严格从参考首帧图开始生成,保持首帧图中的旗鱼主体位置、游动方向、
镜头角度、远古浅海环境、低饱和灰蓝色调、光线方向和压迫氛围不变。
(반드시 참조 첫 프레임 이미지에서 엄격하게 시작해 생성하며, 첫 프레임 이미지의
새치 주체 위치, 유영 방향, 카메라 앵글, 고대 얕은 바다 환경, 저채도 회청 색조,
광선 방향, 압박 분위기를 변하지 않게 유지한다.)
고정 항목을 7개로 열거한다
“첫 프레임을 유지하라”는 한 문장으로는 걸리지 않습니다. 모델이 “유지”를 자기 마음대로 해석하기 때문입니다. 그래서 무엇을 유지하는지를 범주별로 열거합니다.
- 주체 위치 — 화면 어디에 있는가
- 이동 방향 — 어느 쪽으로 가고 있는가
- 카메라 앵글 — 어느 높이에서 보는가
- 환경 — 어떤 공간인가
- 색조 — 어떤 톤인가
- 광선 방향 — 빛이 어디서 오는가
- 분위기 — 어떤 정서인가
1–3번은 기하학, 4–5번은 환경, 6번은 조명, 7번은 정서입니다. 층위가 다른 일곱을 채우면 모델이 “유지”의 범위를 자의적으로 좁힐 여지가 없어집니다. 앞선 글의 기법 8(드리프트를 특정해서 못 박기)과 정확히 같은 사고방식입니다.
같은 선언을 네 지점에 반복한다
더 흥미로운 건 이 선언이 프롬프트 안에서 네 번 반복된다는 점입니다.
| 위치 | 문구 |
|---|---|
| 프롬프트 맨 앞 | 必须严格从参考首帧图开始生成 |
| 【画面核心】 첫 줄 | 严格从参考首帧图开始 |
| 【镜头设计】 0초 구간 | 严格从参考首帧图的第一帧开始 |
| 【核心要求】 첫 줄 | 必须严格从参考首帧图开始生成 |
앞선 글에서 정리한 “컷마다 반복하는 네거티브 리셋”과 동일한 원리입니다. 프롬프트 후반의 지시일수록 어텐션에서 힘이 빠지므로, 가장 중요한 제약은 구조상 서로 다른 위치에 리셋을 걸어둡니다.
한 번만 써도 될 문장을 네 번 쓰는 건 초보의 실수처럼 보이지만, 정반대입니다. 같은 프롬프트를 수백 번 돌려보고 어디서 풀리는지 알아낸 사람만 이렇게 씁니다.
기법 3: 네거티브 2층 구조 — 카테고리와 편향

이 프롬프트에서 네거티브가 차지하는 분량은 전체의 약 4분의 1입니다. 그런데 단순히 많은 게 아니라, 성격이 다른 두 층으로 나뉩니다.
층 1 — 카테고리 네거티브 (넓게, 각 1회)
전용 블록 【负面要求】에 15개 항목이 들어 있고, 그 외에 프롬프트 앞부분과 【画面核心】에도 별도의 금지문이 있습니다. 성격별로 묶으면 이렇습니다.
| 카테고리 | 실제 항목 |
|---|---|
| 시대·세계관 오염 | 현대 인간·선박·잠수 장비·현대 산호초·현대 어군 금지 |
| 화면 문자 | 자막·문자·숫자·로고·텍스처 오버레이·깨진 문자 금지 |
| 주체 변형 | 신체 비율·주둥이·지느러미 구조를 바꾸지 말 것 |
| 장르 이탈 | 만화 느낌·게임 느낌·플라스틱 느낌·저퀄리티 느낌 금지 |
| 과잉 이펙트 | 발광 생물·에너지 이펙트·폭발·혈장 금지 |
| 편집 사고 | 하드컷·플래시컷·난잡한 컷·카메라 난비행·급작스러운 줌 금지 |
| 첫 프레임 파괴 | 첫 프레임 구도를 바꾸지 말 것 |
“시대 오염”과 “장르 이탈”이 특히 이 소재에 고유합니다. 데본기 바다를 그리라고 하면 모델은 학습 데이터에 압도적으로 많은 현대 산호초와 열대어를 끌어옵니다. 고생물을 그리라고 하면 공룡 영화나 몬스터 게임의 톤을 끌어옵니다. 둘 다 명시적으로 잘라내야 합니다.
층 2 — 편향 네거티브 (좁게, 반복)
이쪽이 진짜입니다. 이 영상은 15초 내내 물고기 한 마리가 헤엄치는 게 전부입니다. 그런데 사냥·공격 금지가 프롬프트 전체에 일곱 번 흩어져 있습니다.
不提前展开捕猎 사냥을 미리 전개하지 않는다
不新增攻击剧情 공격 서사를 새로 넣지 않는다
不把旗鱼拍成怪兽 주체를 괴물로 찍지 않는다
不攻击任何生物 어떤 생물도 공격하지 않는다
不得发起攻击 공격을 개시해서는 안 된다
不得出现战斗、撕咬、血腥 전투·물어뜯기·유혈이 나와서는 안 된다
不要擅自添加捕猎、死亡或逃亡剧情 임의로 사냥·죽음·도주 서사를 추가하지 말 것
같은 말을 일곱 번 다르게 씁니다. 중복이 아니라 설계입니다.
이유는 소재 자체가 편향을 부르기 때문입니다. 포식자, 원시 바다, 고속 해양 사냥꾼, 살기(殺氣) 같은 단어를 프롬프트에 넣는 순간, 모델은 학습 데이터의 다큐멘터리 클립을 따라 자동으로 사냥 장면을 만들어냅니다. 이 팀이 원한 건 15초 내내 이어지는 긴장과 미지의 감각이지, 3초 만에 터지는 전투가 아닙니다.
그래서 프롬프트에 필요한 그 단어들을 쓰되, 그 단어들이 부르는 연상을 각 블록마다 따로 눌러 놓은 것입니다.
이걸 내 소재에 옮기는 법
편향 네거티브는 남의 목록을 복사할 수 없습니다. 소재마다 다르기 때문입니다. 직접 축적해야 합니다.
- 최소한의 프롬프트로 3–4회 생성해 봅니다.
- 요청하지 않았는데 계속 나오는 것을 적습니다. (전투, 웃는 얼굴, 카메라 회전, 렌즈 플레어, 슬로모션 등)
- 그것을 하나의 카테고리로 뭉뚱그리지 말고 표현을 바꿔가며 3–7회 프롬프트 각 블록에 분산 배치합니다.
앞선 글에서 소개한 시리즈 연속성 원장에 이 목록을 위한 칸을 하나 더 만들어 두면 좋습니다. 캐릭터별 “드리프트 경보” 옆에 소재별 “편향 경보”를 두는 식입니다.
기법 4: 오디오는 금지와 허용을 함께 쓴다
앞선 글의 드라마팀 프롬프트에서 오디오 지시는 마지막 영어 블록의 두 줄이 전부였습니다(BGM 금지, 대사 언어 강제). 무성 다큐는 대사가 없으니 그 자리에 별도의 【音频要求】 블록이 들어갑니다.
금지: 배경음악 · 나레이션 · 자막 · 화면 문자·숫자·텍스처 오버레이 · 해설 정보
허용 (실제 환경음만):
낮고 무거운 지속적 물살 소리 ← 지속 저역
꼬리지느러미·가슴지느러미가 물을 가르는 소리 ← 주체 동작
원경 어류가 헤엄쳐 만드는 미세한 수체 교란 ← 원경 공간
해저 침전물이 물살에 일어나며 내는 가벼운 마찰음 ← 재질
극저주파의 압박성 고대 해양 환경음 ← 정서
음향 효과는 반드시 절제되고 사실적일 것.
영화 예고편식 임팩트음 · 전자 효과음 · 과장된 저역 굉음 금지.
요점은 허용 목록입니다. “배경음악 없음”만 쓰면 모델은 그 빈자리를 효과음이나 나레이션으로 채웁니다. 침묵은 모델에게 “정보 없음”이지 “침묵”이 아니기 때문입니다.
그래서 층위가 다른 다섯 가지를 지정합니다. 지속 저역 / 주체 동작 / 원경 공간 / 재질 / 정서. 이 다섯 슬롯이 차면 모델이 창작으로 메울 빈자리가 남지 않습니다. 앞선 글의 광영 설계에서 재질별 하이라이트 비율을 세 종류 이상 지정하던 것과 완전히 같은 사고방식입니다. 비어 있으면 모델이 채웁니다.
마지막 줄의 “영화 예고편식 임팩트음 금지”는 다큐·B롤 소재에서 가장 자주 나오는 오디오 편향입니다. 웅장한 소재를 주면 모델이 예고편 사운드 디자인을 흉내 냅니다.
기법 5: 도메인 지식을 프롬프트에 박아 넣는다
“고대 물고기”라고 쓰면 그럴듯한 가짜가 나옵니다. 이 팀은 그렇게 쓰지 않습니다.
场景为约 3.8 亿年前晚泥盆世的温暖热带浅海,
远处隐藏着披骨板的泥盆纪鱼类
(장면은 약 3억 8천만 년 전 후기 데본기의 온난한 열대 얕은 바다.
원경에는 골판을 두른 데본기 어류가 숨어 있어…)
지질시대를 특정하고(후기 데본기), 원경 생물의 해부학적 특징을 명시합니다(골판을 두른 = 판피어류). 주체인 새치도 마찬가지입니다.
가늘고 긴 주둥이 · 측편(側扁)된 유선형 몸체 ·
두드러진 높은 등지느러미 돛 · 초승달형 꼬리지느러미
“돛새치”라는 이름 대신 형태 조건 네 개로 씁니다. 이름은 모델이 어떤 이미지를 떠올릴지 통제할 수 없지만, 형태 조건은 통제할 수 있습니다. 그리고 스레드에 따르면 이 팀은 별도로 정확한 학명 시트를 첨부해 씁니다.
이건 다큐 전용 기법이 아니라 모든 포맷에 적용되는 원리입니다.
| 포맷 | 명시할 것 | 첨부할 자료 |
|---|---|---|
| 자연·과학 다큐 | 지질시대, 서식 환경, 해부학적 특징 | 학명 목록 |
| 사극·시대극 | 연대, 왕조, 계급 | 복식·건축 양식 자료 |
| 밀리터리 | 연도, 전역, 소속 부대 | 장비 제식명 |
| 의료·법률 | 술식명, 조문 | 용어집 |
| 제품·산업 | 소재명, 공정, 규격 | 스펙 시트 |
앞선 글에서 이 팀들의 강점이 “프롬프트 문장력이 아니라 공정 설계”라고 정리했는데, 여기에 하나가 더 붙습니다. 현업 지식입니다.
AI 영상 모델의 성능이 올라갈수록 누구나 그럴듯한 영상을 뽑습니다. 그때 남는 차이는 개연성이고, 개연성은 그 분야를 아는 사람만 프롬프트에 넣을 수 있습니다. 도구가 평준화될수록 도메인 지식의 값이 오르는 구조입니다.
전체 구조: 드라마팀의 8블록 vs 다큐팀의 5블록
앞선 글에서 정리한 드라마팀 문법은 B1~B8의 8블록이었습니다. 이번 다큐팀은 5블록 체계입니다.
[헤더] 길이 · 화면비 · 해상도 · 첫 프레임 락
[스타일] 장르 · 질감 · 렌더 레퍼런스 · 시대 · 색조
[전역 금지] 시대 오염 + 화면 문자
【画面核心】 한 문장 요약 + 주체 외형 조건 + 핵심 정서 + 편향 금지
【镜头设计】 0-3 / 3-6 / 6-9 / 9-12 / 12-15초 균등 5분할
【核心要求】 첫 프레임 락 재선언 + 유지 조건 10개
【音频要求】 금지 목록 + 허용 환경음 5종
【负面要求】 카테고리 네거티브 15개
드라마팀 문법과 대응시켜 보면 사라진 것과 새로 생긴 것이 명확합니다.
| 드라마팀 (B1~B8) | 다큐팀 대응 |
|---|---|
| B1 전역 스타일·질감 | [스타일] — 거의 동일 |
| B2 광영 설계 (상대 비율) | [스타일]에 흡수, 대신 볼류메트릭 광·부유 입자로 표현 |
B3 소재 바인딩 (@태그) |
소멸 → 첫 프레임 락으로 대체 |
| B4 씬 (근경·중경·원경) | 【画面核心】 + 각 구간 지문에 분산 |
| B5 캐스트 (등장 금지) | [전역 금지] + 【负面要求】로 확대 |
| B6 타임라인 | 【镜头设计】 — 균등 5분할 |
| B7 종료 상태·인계 | 12-15초 구간의 마지막 1초 지정으로 축소 |
| B8 CORE GUIDELINES | 【核心要求】 + 【音频要求】로 분화 |
특징적인 차이 네 가지만 짚겠습니다.
-
시간 구간이 균등합니다. 드라마팀 트랙 A는 컷 길이가 4.5초 / 1.5초처럼 불균등했습니다. 대사 길이에 맞춰야 했기 때문입니다. 무성 원테이크는 그 제약이 없으므로 3초씩 5등분이 가장 통제하기 쉽습니다.
-
마지막 1초를 따로 지정합니다.
最后一秒保持旗鱼向前游入未知海域的画面,定格在"现代猎手进入远古杀机海洋"的悬念状态。
(마지막 1초는 새치가 미지의 해역으로 헤엄쳐 들어가는 화면을 유지하여,
"현대의 사냥꾼이 고대의 살기 어린 바다로 진입한다"는 서스펜스 상태로 정지시킨다.)
앞선 글의 B7(종료 상태·다음 화 인계)이 압축된 형태입니다. 다음 영상의 첫 프레임으로 그대로 쓸 수 있는 상태를 만들어 두는 것이고, 동시에 숏폼의 루프 재생과 이탈률을 노린 설계이기도 합니다.
-
카메라 지시가 매우 절제되어 있습니다. “느린 푸시(推)와 완만한 풀(拉)만 사용하고, 빠르고 난잡한 컷 전환을 쓰지 않는다”가 전부입니다. 원테이크에서 카메라를 많이 지시하면 모델이 컷 전환으로 오해합니다.
-
네거티브가 분량의 1/4입니다. 드라마팀은 광영 설계에 20%를 썼고, 다큐팀은 네거티브에 25%를 씁니다. 어디에 예산을 쓰는지가 곧 그 팀이 무엇에서 실패해 봤는지를 드러냅니다.
실전 템플릿: I2V 첫 프레임 계승형
위 구조를 자기 소재에 옮겨 쓸 수 있도록 슬롯화한 템플릿입니다. 무성·원테이크·I2V 조건에서 그대로 씁니다.
길이 {N}초, 화면비 {16:9}, {1920×1088}.
반드시 참조 첫 프레임 이미지에서 엄격하게 시작해 생성하며, 첫 프레임 이미지의
{주체} 위치, {이동} 방향, 카메라 앵글, {환경}, {색조}, 광선 방향, {분위기}를
변하지 않게 유지한다.
{영화급 초실사 {장르} 스타일}, {촬영 질감}, 8K 디테일, {렌더 레퍼런스} 급 화질,
사실적인 {주체}의 {구조}와 {비율}, 사실적인 {재질1}·{재질2}·{운동},
사실적인 {환경 매질 산란}·{부유 입자}·{볼류메트릭 광}·{바닥 침전물}.
장면은 {정확한 시대·장소 특정}. 원경에는 {부수 요소}가 있어 {정서}를 형성한다.
{저채도 색조 3종}, {질감 레퍼런스}, 카메라 운동은 사실적이고 절제되고 연속적으로.
화면에 {시대 오염 요소 목록}, 문자, 자막, 텍스처 오버레이,
또는 어떠한 {금지 인공물}도 등장해서는 안 된다.
【화면 핵심】
참조 첫 프레임 이미지에서 엄격하게 시작: {한 문장 로그라인}.
{주체}는 전편의 유일한 시각 주체이며, 반드시 {형태 조건 1}, {형태 조건 2},
{형태 조건 3}, {형태 조건 4}를 유지해야 한다.
화면은 {핵심 정서}를 중점적으로 표현한다. {편향 금지 1}, {편향 금지 2}, {편향 금지 3}.
【카메라 설계】
0-{a}초: 참조 첫 프레임 이미지의 첫 프레임에서 엄격하게 시작한다. {주체}는 첫 프레임의
위치와 방향을 유지한 채 {느린 동작}. 카메라는 {위치}에 두고 {샷사이즈}로 안정 추적한다.
{전경 요소}는 변하지 않게 유지한다.
{a}-{b}초: 카메라는 {움직임}. {주체의 상태 변화}. {편향 금지 재선언}.
{b}-{c}초: 카메라는 {움직임}. {디테일 노출 대상}. 첫 프레임의 환경과 광선 논리를
유지하며, 장면을 바꾸지 않고 다른 장소로 전환하지 않는다.
{c}-{d}초: 카메라는 {앵글 변화}. {원경 요소 등장}, 그러나 {접근·공격 금지}.
화면은 원테이크의 연속 운동을 유지한다.
{d}-{N}초: 카메라는 천천히 뒤로 빠지고, {주체}는 {최종 방향}으로 이동한다.
마지막 1초는 {서스펜스 상태}로 정지시킨다. {서사 추가 금지}.
【핵심 요구】
반드시 참조 첫 프레임 이미지에서 엄격하게 시작해 생성할 것.
첫 프레임 이미지의 {구도}, {주체 위치}, {이동 방향}, {환경}, {광선}, {색조},
{카메라 앵글}을 유지할 것.
{주체}는 반드시 유일한 주요 시각 주체여야 한다.
{주체}의 외형은 반드시 {실제 기준}에 부합해야 하며, {오인 대상 1}·{오인 대상 2}로
변해서는 안 된다.
{특징 부위}는 반드시 {실제 구조}를 유지하며, {과장 변형}되지 않는다.
{환경}은 반드시 {시대 조건}에 부합해야 하며, {시대 이탈 요소}는 등장하지 않는다.
전 구간에서 카메라의 실제 운동 관성을 유지할 것.
연속 추적 촬영과 느린 푸시·풀을 사용하고, 빠른 난잡한 컷 전환을 쓰지 않는다.
결말은 반드시 {인계 상태}를 유지할 것.
【오디오 요구】
배경음악 금지. 나레이션 금지. 자막 금지. 어떠한 화면 문자·숫자·해설 정보도 금지.
실제 환경음만 유지한다:
{지속 저역음}
{주체 동작음}
{원경 공간음}
{재질 마찰음}
{정서 환경음}
음향 효과는 반드시 절제되고 사실적이어야 하며,
영화 예고편식 임팩트음·전자 효과음·과장된 저역 굉음을 사용하지 않는다.
【네거티브 요구】
첫 프레임 구도를 바꾸지 말 것. 시작부터 장면을 전환하지 말 것.
{주체}를 교체하지 말 것. {금지 인물·사물}을 새로 넣지 말 것.
{시대 오염 요소 목록}을 등장시키지 말 것.
{주체}를 {과장 변형}으로 만들지 말 것.
만화 느낌, 게임 느낌, 플라스틱 느낌, 저퀄리티 느낌이 나오지 않게 할 것.
발광 생물, 에너지 이펙트, 폭발, {과잉 이펙트}가 나오지 않게 할 것.
자막, 문자, 숫자, 로고, 텍스처 오버레이, 깨진 문자가 나오지 않게 할 것.
하드컷, 플래시컷, 난잡한 컷, 카메라 난비행, 급작스러운 줌을 쓰지 말 것.
{주체}의 {비율}, {부위 1}, {부위 2} 구조를 바꾸지 말 것.
{편향 서사}를 임의로 추가하지 말 것.
첫 프레임 락이 네 곳에 있는지 반드시 확인하세요. 헤더, 【화면 핵심】 첫 줄, 【카메라 설계】 0초 구간, 【핵심 요구】 첫 줄입니다. 이 템플릿에서 가장 자주 실수로 빠지는 부분입니다.
무엇을 언제 쓸 것인가
두 글에 걸쳐 세 팀의 문법이 나왔습니다. 자기 프로젝트에 무엇을 쓸지 정하는 기준입니다.
| 조건 | 쓸 문법 | 근거 |
|---|---|---|
| 대사 있음, 컷 여러 개, 애니 룩 | 드라마팀 트랙 A (컷 분할형) | 컷 길이 통제, 부분 리롤 가능 |
| 카메라 무빙이 연출의 핵심, 실사 | 드라마팀 트랙 B (연속 촬영형) | 편집점 자체가 없음 |
| 무성, 원테이크, 참조 이미지 1장 | 다큐팀 첫 프레임 계승형 | I2V 정합 유지 |
| 앞 영상의 마지막 프레임에서 이어야 함 | 다큐팀 첫 프레임 계승형 | 이 문법의 존재 이유 |
| 제품·B롤·질감 소재 | 다큐팀 문법에서 【화면 핵심】만 교체 | 캐릭터 없음이 전제로 동일 |
그리고 문법과 무관하게 모든 경우에 적용되는 것 세 가지가 있습니다.
- 해상도 16의 배수 통일 — 레퍼런스 이미지부터 최종 인코딩까지 전 구간. 비용이 0인데 첫 프레임 불일치를 구조적으로 없앱니다.
- 편향 네거티브 축적 — 자기 소재를 3–4회 돌려보고 요청하지 않았는데 나오는 것을 적어, 표현을 바꿔가며 프롬프트 곳곳에 분산 배치합니다.
- 비어 있는 슬롯을 남기지 않기 — 오디오든 조명이든 원경이든, 지정하지 않은 자리는 모델이 학습 데이터로 채웁니다.
세 번째가 사실 앞선 글과 이번 글을 관통하는 유일한 원리입니다. 드라마팀의 “등장 금지” 선언도, 광영 설계의 재질별 비율도, 다큐팀의 허용 환경음 5종도 전부 같은 말을 하고 있습니다.
정리
세 번째 팀의 프롬프트에서 새로 얻은 것은 다섯 가지입니다.
- 1920×1088: 16×16 매크로블록 관행에서 착안해 파이프라인 전 구간의 해상도를 통일한 경험적 규칙입니다. 크롭 변환을 줄일 수 있는지 동일 입력으로 비교하고, 레퍼런스 이미지도 같은 규격으로 맞춥니다.
- 첫 프레임 계승 문법: 고정 항목을 기하·환경·조명·정서 7개로 열거하고, 같은 선언을 프롬프트 안 네 지점에 반복합니다.
- 네거티브 2층 구조: 넓게 한 번 거는 카테고리 네거티브와, 소재가 부르는 편향을 특정해 표현을 바꿔가며 반복하는 편향 네거티브를 분리합니다.
- 오디오 금지 + 허용: 침묵은 모델에게 정보가 아닙니다. 층위가 다른 환경음 5종으로 빈자리를 채웁니다.
- 도메인 지식 명시: 시대·해부학·규격을 이름이 아니라 조건으로 씁니다. 도구가 평준화될수록 여기서 차이가 벌어집니다.
앞선 글에서 이 팀들의 프롬프트를 “예술이 아니라 공장 작업 지시서”라고 표현했는데, 이번 프롬프트는 거기서 한 단계 더 나아가 있습니다. 연출가가 아니라 인코더와 실패 로그의 관점에서 쓰인 문서입니다.
1088이라는 숫자와 일곱 번 반복되는 사냥 금지는 둘 다 “이걸 어떻게 알았을까” 싶은 항목이지만, 답은 같습니다. 같은 걸 수백 번 돌려봤기 때문입니다. 프롬프트 엔지니어링에서 재현 가능한 자산은 결국 문장이 아니라 실패 목록이라는 점을, 이 프롬프트가 분량 배분으로 증명하고 있습니다.
출처
@toonkit_official 스레드(post/DcTO_-hCJT3, 2026-08-21)에 공개된 프롬프트 전문 슬라이드 8장을 역분석했습니다. 앞선 두 팀과 마찬가지로 어뷰징 대응 과정에서 확보된 실제 프로덕션 프롬프트입니다.
- ITU-T H.264 권고안: H.264의 매크로블록과 프레임 크롭 구조를 확인하는 1차 표준 문서
- ByteDance Seedance 2.5 공식 발표: 2026년 7월 31일 공개된 최신 세대의 최대 30초 생성·연장·참조 기능 안내
- ByteDance Seedance 2.0 공식 발표: 이미지·영상·오디오 참조와 I2V 기능의 공식 범위 안내
본 포스트는 프롬프트의 구조와 설계 원리를 다루며, 구조 자체는 공정 설계이므로 중립적입니다. 다만 소재(생물 종·시대·서사)는 각자의 기획으로 채우시기 바랍니다. 타인의 기획을 그대로 복제하는 용도가 아닙니다.
이어지는 글: 중국 AI 숏드라마 공장의 프롬프트 엔지니어링 해부: 1-Shot 90% 일관성 달성 비법과 실전 템플릿