我用 Codex + Remotion,做了一條唐朝紙片分層動畫

Cover Image

原始來源與檔名:2026-07-14T091951+0800-我用 Codex + Remotion,做了一条唐朝纸片分层动画.md


SOURCE | 資訊源評估

NAPKIN | 餐巾纸

餐巾纸公式

高質感紙片動畫 = Codex(調度中樞) + Imagegen(獨立素材生成) + Remotion(可編程動畫與排版) + F5-TTS(語音)

真正的紙片動畫核心不是「生成一張漂亮的圖」,而是「生成可解耦的圖層元件」並以代碼控制其時空關係。

一句话

透過將大語言模型 (Codex) 作為總控中樞,串聯生圖、去背、語音與代碼動畫引擎 (Remotion),我們能打造一條可程式化、可批量復用的 AI 本地影音生產流水線。

餐巾纸草图

[ AI 生成 Pipeline ]
Imagegen(綠幕圖) -> Python(去背/拆圖)
F5-TTS(音訊) -> FFmpeg(微調)
       |
       v
[ Codex 控制台 (生成 React 程式碼) ]
       |
       v
[ Remotion 渲染引擎 ]
   z: 1 (背景:推鏡 1%)
   z: 2 (後排群臣:微動)
   z: 3 (主角皇帝:大幅入鏡 + 音效)
   z: 4 (前景:白邊 + 陰影)

NAPKIN | 餐巾紙

餐巾紙公式

N/A

一句話

N/A

餐巾紙草圖

N/A

ROUND 1: SKELETON | 骨架掃描

“這本書在說什麼”

章節骨架

  1. 工具全景: 定義 Codex, Imagegen, Python, F5-TTS, Remotion, FFmpeg 的職責。
  2. 確定鏡頭 (前置): 全景 vs 特寫,決定主次。
  3. 四層拆解: 背景、後排、主體、前景。
  4. 底板生成: 製作無人物純環境底圖。
  5. 角色生圖與去背: 設定綠幕、白邊提示詞,再以 Python 腳本批量切割。
  6. Remotion 靜態排版: 定義大小比例與 zIndex 遮擋。
  7. 分類動畫設計: 依據角色重要性給予不同距離與延遲 (Delay) 的動效。
  8. 立體感塑造: 利用 CSS drop-shadow 製作剪紙陰影與厚度。
  9. 音訊合成: 旁白定時長,加上環境音與專屬入站音效。
  10. 預覽與渲染: 以 FFmpeg 抽幀驗收並最終輸出。

ROUND 2: DISSECTION | 血肉解剖

“憑什麼這麼說”

論證鏈

單一影片生成模型無法精確控制畫面層次 --> 必須轉向模組化生產 --> 將視覺元素解耦為獨立 PNG (生圖+去背) --> 利用現代前端技術 (Remotion) 對圖層進行精確的數學與時間軸控制 --> 讓 Codex 擔任此工作流的自動化編排者 --> 實現可高度客製化且具立體感的紙片動畫

關鍵證據

  1. 生圖反模式 (Anti-pattern):作者明確指出「不要讓繪圖模型直接生成整段動畫,也不要把主要人物畫進背景」,這解決了 AI 生成常遇到的元素沾黏問題。
  2. 角色分級程式碼: 展示了 primary, secondary, tertiary 角色的 distance, rise, startScale 參數差異,證明了程式化動畫能精準控制視覺焦點。
  3. 錯峰入場 (Delay): 程式碼中 delay: 4, delay: 18 等設定,實證了「敘事建立順序」的重要性,打破了一次性全圖載入的生硬感。

隱形假設與邊界條件

ROUND 3: SOUL | 靈魂提取

“還能怎麼用”

留白提問 (Guided Reflection)

跨域映射

DEEP READ | 精讀指引 (Must-Read Segments)

[!IMPORTANT] 學習的本質需要「認知阻力」。請親自回到原文閱讀以下核心段落,感受原始論述的阻力,不要只依賴 AI 的總結。

  1. 零、这条视频用了哪些工具: 強烈推薦閱讀這份工具清單。它完美示範了如何將 AI 從一個「許願池 (Prompt-in, Magic-out)」轉化為一個「工程系統 (Engineering Pipeline)」。
  2. 四、用 Imagegen 生成角色,再用 Python 抠图拆层: 這裡的 Prompt 撰寫邏輯(純綠背景、白色剪紙描邊、完整不裁切)是將非結構化的生成式 AI 降維打擊成結構化素材的標準教材。

我用 Codex + Remotion,做了一條唐朝紙片分層動畫 (Architectural Deep Dive)

前言/背景

當前的 AI 影片生成工具多數採用「圖片轉影片 (Image-to-Video)」的整體生成模式,往往導致畫面缺乏景深層次、元素邊界沾黏且無法進行精確修改。本文作者打破此困境,提出了一套「工程化、代碼化」的 AI 影片製作工作流 (Pipeline)。透過將大語言模型 (Codex) 作為自動化總控端,串聯生圖、去背、語音與 React 動畫引擎 (Remotion),成功實現了具備物理空間感與精準時間軸的「唐朝紙片分層動畫」。

章節詳細總結

1. 系統架構與工具鏈職責 (Toolchain Architecture)

這不是一套單一軟體,而是一個由多節點組成的本地微服務架構:

2. 資產解耦與模組化生成 (Asset Decoupling)

3. 基於 Remotion 的可程式化場景重構 (Programmable Scene Composition)

將解耦後的素材導入 React 專案中,以程式碼定義其物理與時空關係。

4. 影音同步與自動化渲染 (A/V Sync & Rendering)

總結與結論