持續更新中

AI 漫劇
實戰手冊

把網路小說跑成動畫短劇,一個人跑完劇本到成片的全流程。

這裡不是提示詞模板合集。是跑通之後留下的東西——每一條都是真實生成換來的失敗邊界,附幀證據。包括兩段無刪減的成片實拍、三次被審核攔截的覆盤, 和一套會隨覆盤資料自動降級的成本模型。

40
劇本
20
成片
半天
單人一集
14
實測結論
01 / 產線

五步流水線

AI 能包辦前兩步,第三步必須停下來等人,後兩步是人機交替。真正的設計難點不在步驟劃分。

01
劇本
AI

原著精讀 → 改編大綱 → 分集劇本。每集落筆前先把劇情聊定稿,重點查因果通不通、有沒有跳鏡頭。

02
分鏡
AI

不再單寫分鏡表,直接落提示詞篇。分鏡資訊以段頭備註併入:段號 | 內容概述 | 風險檔·版數 | 段末銜接。

03
出圖
AI + 人

角色卡、場景卡、道具卡。AI 給提示詞,人來出圖並逐張驗收。

04
影片生成
AI + 人

提示詞批次注入生成佇列。新集、新場景、新角色首次上陣單條跑、當場看,通過才放下一條。

05
剪輯

首尾各剪掉約 1.5 秒 → 按類型加速 → 段間硬切拼接 → 加字幕音效。

硬關卡

「出圖並驗收」是唯一必須卡住等人的一步

依賴順序不可逆:設定集 → 生圖提示詞 → 出圖並驗收 → 分鏡表 → 影片提示詞 → 生成 → 剪輯。跳過驗收直接寫分鏡,等於在沒有角色形象的前提下設計鏡頭,後面一定返工。流水線設計裡最重要的從來不是步驟本身,是想清楚哪一步必須停下來等人確認。

8 個子 agent 並行精讀 43.3 萬字原著

新作品立項要精讀一部 192 章的長篇。單 agent 順序讀會爆上下文,而且讀到後面忘了前面。做法是按章節切成 8 份、8 個子 agent 並行精讀,各自產出結構化檔案,再彙總成全書總覽。長內容的上下文問題,切分加彙總比換更大的模型更管用。

02 / 實測

14 條實測結論

按五個區域分組。標籤寫的是這件事能不能做——「做不了」的那幾條最值錢,它們決定了分鏡要繞著走。

結構與時長4
01有條件

段數按目標成片時長倒推,不按劇情自然分

每段 15 秒生成、約 12 秒內容,剪掉首尾再加速後落地約 8–10 秒成片。常規集目標 80–90 秒,對應 11–12 段;首集放寬到 2–3 分鐘,需要 16–22 段——首集要鋪世界觀和人設,長一點值得。

  • 算式:(段數 × 12 秒)÷ 平均加速比 ≥ 目標時長
  • 每段是一個完整小場景,不是「一鏡一動作」——拆太細反而踩下一條的坑
02有條件實測 G

一律按 15 秒生成,但內容只按 12 秒的量設計

不能薄,也不能滿。薄了模型會先定住不動、後半段自己瞎編——實測給 15 秒配一句短台詞,結果前 7 秒發呆、後段編出提示詞裡沒有的台詞。塞滿 15 秒則動作趕,還會擠進要剪掉的首尾區。

  • 按次計費而非按時長,所以一律選最長檔把素材榨滿,省錢靠減少條數而不是縮短時長
03做不了實測 E19

不寫「零幀起手」,開頭會白白浪費 5 秒

預設行為是先給一段 establishing ramp:角色站定、環境鋪墊,動作要 5 秒後才真正開始。15 秒的條子裡丟掉 5 秒,等於三分之一預算打水漂。

  • 每段第一句寫死:一開場第一幀即〔動作已在進行中〕、無預備鋪墊
  • 寫了之後 ramp 大幅壓縮,但仍有殘餘——剪輯裡砍掉首尾各約 1.5 秒兜底
04能做

後期加速是標配,不是補救

生成出來的動作天生偏慢。打戲這類滿內容條 2 倍速、對白條 1.5 倍速、靜態和短內容原速。這一步要在寫提示詞時就算進時長裡,不能等剪的時候才發現節奏拖。

人物與對白4
05有條件

人物動作要分級:日常能做,武打站樁

走、坐、寫字、夠物、遞東西這類日常動作能連貫完成,品質還不錯。但揮劍、連招、蓄力這類武打招式一律變成站樁——人杵在那不動。所以文戲正常寫動作,打戲必須換一套寫法(見第 13 條)。

  • 情緒特寫只取 2–3 秒:臉上沒有大表情變化時,長特寫就是站樁的臉部版
  • 只有震驚、爆哭、狂笑這類大表情,或名場面高光,才值得拉長
06能做

雙人同框對白能用,但綁定靠圖序不靠名字

誰放在第一張參考圖的位置,誰就是畫面主體和說話人。寫名字沒用,模型認的是圖序。按這個規則來不會串臉。

  • 說話人放第一位,非說話人放後面,並顯式寫「嘴唇緊閉、不動」
07做不了

一條裡只能有一個人說話

有台詞的鏡頭只留一個口型——說話人單獨一張臉,或者同框但對方閉嘴。兩人兩句必崩,這是全劇最高頻的崩點,沒有例外。

08做不了

同一角色的音色跨條會飄

同一個角色分幾條生成,嗓音會不一樣。要聲線統一只能在剪輯階段整集重新配音,生成側無解。

畫面與素材4
09有條件

參考圖掛不掛,按「獨特性」和「跨集復用」兩把尺子量

角色、坐騎、法寶這類獨特複雜的實體必須掛圖;跨集出現或作為戲眼的道具也必須掛圖——純靠文字描述,一把木劍會漂成金屬劍。一次性的簡單道具(食物、包袱、字條)文字帶過即可。特寫鏡頭也要帶場景圖鎖住背景。

  • 沒有卡的實體一定被瞎編:一隻靈禽在無卡狀態下被編成了完全不相干的水鳥
  • 拿上一條的末幀截圖當下一條的參考圖接續——不可行,會直接報錯
  • 跨條一致性只能靠角色卡,沒有別的辦法
10做不了

第一張參考圖不只定主體,還定背景基調

把純色底的角色卡放在第一位,模型會把那塊純色底當成背景帶出來,整個場景丟失。實測一條劍雨鏡頭因此背景全無。

  • 背景重要的條:場景圖放第一位,主體卡放第二位
  • 對白條若必須讓說話人佔第一位,那張角色卡本身要自帶可用背景
11做不了

中文字不能入鏡,手部大特寫要降級

畫面裡出現中文必然亂碼,一律交給後期加字幕貼圖。手部大特寫是崩壞率最高的畫面,焦點要挪到臉上,手降到畫面下緣虛化處理。

12有條件

建築方位必須寫死,模糊方位詞一律被理解成「在水裡」

寫「臨水涼亭」,生成出來的亭子建在水中央、台階伸進水裡、沒有岸。「臨水/湖畔/依山」這類文學化方位詞,模型統統理解成懸空或泡在水裡。

  • 正確寫法:建在什麼地面上 + 有什麼路通到它 + 水或崖在哪個方向、多遠
  • 排除項裡再點名「水中建築、建在水面上、台階伸入水中、棧橋」
  • 同一張戶外場景卡一集裡最多用 2 段,防審美疲勞;家宅這類固定生活場景不受限
打戲專項1
13能做

打戲走「御物流」:人不動,讓物體和特效去打

模型強在物體運動和特效,廢在人物武打。所以主角立而不動(正好符合宗師人設,順帶避開站樁問題),動作全部交給飛劍、御物、雷光特效和敵人。

  • 接觸點用白光或塵爆遮住,不實拍碰撞
  • 威壓、殺氣這類不可見之物只寫結果,不寫本體
  • 不要寫「網」——會真的變成蜘蛛網
  • 滿內容 + 零幀起手 + 後期 2 倍速,三件套齊上
審核1
14有條件

三類詞族會被判違規,改法是換關係不是換詞

被攔過三次,每次的教訓都不是「這個詞不能用」,而是「這層關係不能拍」。把人比作牲畜貨物的寫法會被判成人口買賣;挾持加限制自由的台詞組合會被判非法拘禁;半寫實的人臉參考圖會被判成真人素材。

  • 物化人:改用招工、相看的語言,動作從「俯身湊近端詳」改成「背著手繞半圈」拉開距離
  • 限制人身自由:物理挾持改成法術托舉,威脅台詞從「別想走了」改成「跟我回去一趟」——威脅感在,但不涉人身自由
  • 真人誤判:解法在參考圖的形態,不在提示詞
  • 暴力死亡和親密貼身兩類整體避開,不要試探邊界
03 / 實拍

成片長什麼樣

兩段實拍,都無刪減。一段打戲、一段文戲——正好是模型最強和最弱的兩頭,上面那些結論就是被這兩類鏡頭逼出來的。預設靜音,點開有音效。

御劍打戲打戲 · 御物流28 秒 · 無刪減

整段沒有一句台詞,主角從頭到尾站在岩石上沒有移動過。所有動作都交給木劍、黑色劍氣和妖獸——這就是「御物流」在成片裡的樣子。

  1. 00:00妖獸壓住樵夫,紫雷落,全景交代危機
  2. 00:03主角落在岩頂,大氅被風掀起,全程立而不動
  3. 00:07抬手,木劍破空飛來懸停掌心
  4. 00:11劍氣纏繞妖獸收緊,動作全部由物體完成
  5. 00:21劍尖抵住眉心,妖氣收縮成球
  6. 00:25木劍立地,內丹剝離,收妖完成
为什么这么设计

武打招式讓模型自己演,人物一定站樁。承認這一點之後,把動作全部轉移到可以「飛」的物體上,再用特效遮住所有接觸點——難度就從模型最弱的地方,挪到了它最強的地方。

九尾狐妖文戲 · 多人同框25 秒 · 無刪減

和打戲相反的一類考驗:三個人同框、有來有回的對白、九條毛尾巴同時在動。這幾樣單拎出來都是高崩率項,能同時立住靠的是一條死規矩——一條裡只讓一個人開口。

  1. 00:00女主提著鳥籠推門進屋,交代人和地點
  2. 00:03全景:榻上九尾鋪開,先把奇觀立住
  3. 00:07有人在榻邊照料,交代關係,狐妖保持不動
  4. 00:13狐妖起身,九條尾巴完全展開——本段的戲眼
  5. 00:15切女主驚嘆特寫,這一條裡只有她開口
  6. 00:18反打狐妖怒目,情緒反差靠切鏡完成,不靠演
  7. 00:22轉到雲上收尾,喜劇留白
为什么这么设计

多人同框最容易崩在口型上——兩個人各說一句必崩,臉會互相漂移。解法不是寫更細的提示詞,是改設計:有台詞的鏡頭只留一個口型,其他人顯式寫「嘴唇緊閉」,把對話拆成一來一回兩條。情緒反差也一樣,靠切鏡完成而不是讓模型演——它給不了細膩的表情演變。毛髮反而不是問題,它屬於「物體運動」那一類,正好是模型的強項。

04 / 流程

每集怎麼跑

七步。每一步下面那行小字是踩過坑之後立的規矩——流程本身不難,難的是知道哪裡不能省。

  1. 開工前掃約束清單

    成本模型、時長檔位、審核紅線、角色卡建了哪些、已驗證的失敗模式——每個新專案開工前填一次。約束是隱性知識,使用者自己往往也沒意識到,所以要逐條填空確認,別指望對方主動交代。

    待確認的項主動問,不許猜

  2. ①.5

    劇情討論定稿

    寫任何分鏡前先把本集劇情聊定。只查兩件事:邏輯通不通(每個事件有因果、動機成立、和前後集接得上)、跳不跳鏡頭(觀眾視角下沒有憑空出現或消失的人和物,位置轉移都有交代)。

    拍板前不許先寫檔案——搶跑過一次,返工整集

  3. 直接落提示詞,不再單寫分鏡表

    分鏡資訊以段頭備註併入提示詞篇:段號 | 內容概述 | 風險檔·版數 | 段末銜接。一份檔案既能錄入生成佇列,人也直接看這份,不用維護兩套。

    每段標風險級和命中清單第幾條,可覆核、可迭代

  4. 按統一模板寫每一段

    開頭一句風格宣告,場景獨立成自然段,參考圖寫成句子而不是標籤,正文按秒段分 3–4 拍(1 秒 / 2–6 秒 / 7–11 秒 / 12–15 秒),運鏡交回模型不要自己指定,硬性約束全部收進結尾的英文段落——英文直達生成層,不經翻譯損耗,還能繞開中文違禁詞的誤判。

    模板是照抄跑通的成功案例定下來的,不是設計出來的

  5. 小步驗證,不整集排隊

    新集、新場景、新角色首次上陣,先單條注入、生成後當場看、通過再放下一條。確認這一集的寫法穩了,剩餘同類低風險段才批次排。

    整集一次排隊,一旦有錯整批作廢,錯誤還會批次擴散。高風險段永遠單跑單看

  6. 生成後改名歸檔

    影片統一改名為「集-段-版」,生成次數回填到覆盤表。這一列的數字就是下一輪校準風險分級的資料。

  7. 剪輯成片

    首尾各剪掉約 1.5 秒(開頭殘餘 ramp、結尾抖動),只留中間約 12 秒 → 按類型加速 → 段間硬切拼接 → 加中文字幕和貼圖 → 鋪音效。

    不做轉場特效,一律硬切

  8. 覆盤迭代

    崩掉的段進崩案表。某類「低風險」段反覆崩,就升級它的風險檔,清單跟著變準。新踩的坑按准入門檻分類:能說清物理原因的進崩案表,原因不明的先進實驗記錄觀察,攢夠 3 次再升級。

    這一步是整套 SOP 能自我進化的原因,跳過它清單就是死的

笑點也要按穩定性分配

喜劇效果和生成穩定性在這裡是同向的,別逆著來。笑點優先往兩個口袋塞:一是靈寵的反應鏡——單主體、一個動作(裝死、縮脖、翻白眼),成功率最高,截圖傳播率也最高;二是主角的口嫌體直——嘴上嫌棄但手上照做,全靠動作和視線,不依賴台詞,沒有口型風險。絕對不要往多人對白裡塞:三主體加對輪台詞是崩率最高的組合。

05 / 成本

1 版還是 2 版

按次計費的模型下,每一段要不要多生成一版備選,是全片成本的主要變數。這張表回答的就是這件事。

高風險命中任一即出 2 版
  • 1打戲、術法、動作戲
  • 2多主體同框(兩人以上,或人 + 獸)
  • 3點睛幀、關鍵伏筆、名台詞
  • 4複雜特效或奇觀場面
  • 5中文字、道具特寫
  • 6審核擦邊(親密、血腥、暴力邊緣)
低風險出 1 版,崩了再補
  • 1單人 + 單場景 + 日常動作(走、坐、寫、夠物、說一句)
  • 2單人情緒或臉部特寫——拍臉是模型最強項,剪 2–3 秒
  • 3空鏡氛圍

遞降扣子:讓清單靠資料自己進化

甜文裡對話戲佔比高,全程 2 版等於成本翻倍。所以定了一條降級機制:雙人同框對白暫按高風險出 2 版,連續 3 集實測其重試率與低風險段持平之後,降為 1 版。其它高風險項同理——某類反覆不崩就降級。這條機制才是整個分級表的核心,沒有它,清單只會越加越長、成本越滾越高。

點睛幀別一刀切

要看內容分:單人臉部特寫的點睛幀(回眸、睥睨)是模型強項,算低風險出 1 版;複雜動作、特效、多主體的點睛幀才算高風險出 2 版。把「重要」直接等同於「高風險」是最常見的浪費。

成本模型:按次計費,不看時長

  • 省錢只有兩條路:一律選最長時長檔把素材榨滿,以及減少生成條數
  • 所以「縮短時長省錢」是錯覺——同樣一次錢,15 秒和 5 秒一個價
  • 風險分級本質上是在回答:這一段值不值得多花一次錢買個備選
06 / 事故

踩坑檔案

四次真實事故。選這四條是因為它們各自代表一類不同的失敗原因——修好一個 bug 不值錢,看懂它屬於哪一類才值錢。

案例 01

文學化方位詞

我寫的

臨水涼亭

它給我的

亭子建在水中央,台階直接伸進水裡,畫面裡根本沒有岸

為什麼

「臨水/湖畔/依山」在人類語言裡是相對位置,在模型那裡被解成絕對位置——臨水就是在水上。它沒有「岸」這個中間概念。

怎麼改

改寫成:建在什麼地面上 + 有什麼路通到它 + 水在哪個方向多遠,再把「水中建築、台階伸入水中」寫進排除項。

那一條

凡是靠讀者腦補補全的描述,模型都會用最字面的方式補全。空間關係必須寫成可測量的。

案例 02

讓畫面裡的東西消失

我寫的

靈寵鑽回符紙裡

它給我的

不但沒消失,還複製成了三隻

為什麼

物體一旦入畫就會保留到最後一幀。「消失」這個動作模型演不了,它只會理解成「這個東西很重要,多畫幾個」。

怎麼改

一條裡只寫「出現」,「消失」交給下一段不入鏡或者剪輯切段完成。確實要在畫面裡收走,就拍一個沒有主體的近景特寫。

那一條

生成模型只會做加法。所有減法都得靠剪輯完成——這條改變了我寫分鏡的整個思路。

案例 03

沒建卡就上陣

我寫的

一隻靈禽(只有文字描述,沒掛參考圖)

它給我的

被編成一隻毫不相干的水鳥,且每條長得都不一樣

為什麼

沒有參考圖時模型不會承認自己不知道,它會從文字裡找最接近的常見物種直接頂上。

怎麼改

任何要反覆出現的實體,先做卡再寫它的戲。沒卡就不許入鏡。

那一條

AI 不會說「我不知道」,它會給你一個自信的錯誤答案。這在生圖和寫程式上是同一個毛病。

案例 04

靜止描述堆太多

我寫的

「看了很久很久」「紋絲不動」,結尾也沒寫「說話的過程」

它給我的

跑出來一張靜態圖片,不是影片

為什麼

靜止的描述堆積到一定密度,任務本身被判成了圖片任務。模型是按描述的運動含量決定輸出形態的。

怎麼改

三處必帶:開頭宣告這是一段有連續運動的影片、不是靜態圖;結尾句寫明「特寫誰說話的過程」或「跟拍誰的連續動作過程」;排除項加上「無靜止畫面、無定格」。靜止情緒改寫成帶過程的動作——「眼神一點點變化」「眉頭緩緩皺緊」。

那一條

你以為你在描述一個畫面,模型在統計這段文字裡有多少運動。寫法決定它把任務歸成哪一類。