段數按目標成片時長倒推,不按劇情自然分
每段 15 秒生成、約 12 秒內容,剪掉首尾再加速後落地約 8–10 秒成片。常規集目標 80–90 秒,對應 11–12 段;首集放寬到 2–3 分鐘,需要 16–22 段——首集要鋪世界觀和人設,長一點值得。
- 算式:(段數 × 12 秒)÷ 平均加速比 ≥ 目標時長
- 每段是一個完整小場景,不是「一鏡一動作」——拆太細反而踩下一條的坑
把網路小說跑成動畫短劇,一個人跑完劇本到成片的全流程。
這裡不是提示詞模板合集。是跑通之後留下的東西——每一條都是真實生成換來的失敗邊界,附幀證據。包括兩段無刪減的成片實拍、三次被審核攔截的覆盤, 和一套會隨覆盤資料自動降級的成本模型。
AI 能包辦前兩步,第三步必須停下來等人,後兩步是人機交替。真正的設計難點不在步驟劃分。
原著精讀 → 改編大綱 → 分集劇本。每集落筆前先把劇情聊定稿,重點查因果通不通、有沒有跳鏡頭。
不再單寫分鏡表,直接落提示詞篇。分鏡資訊以段頭備註併入:段號 | 內容概述 | 風險檔·版數 | 段末銜接。
角色卡、場景卡、道具卡。AI 給提示詞,人來出圖並逐張驗收。
提示詞批次注入生成佇列。新集、新場景、新角色首次上陣單條跑、當場看,通過才放下一條。
首尾各剪掉約 1.5 秒 → 按類型加速 → 段間硬切拼接 → 加字幕音效。
依賴順序不可逆:設定集 → 生圖提示詞 → 出圖並驗收 → 分鏡表 → 影片提示詞 → 生成 → 剪輯。跳過驗收直接寫分鏡,等於在沒有角色形象的前提下設計鏡頭,後面一定返工。流水線設計裡最重要的從來不是步驟本身,是想清楚哪一步必須停下來等人確認。
新作品立項要精讀一部 192 章的長篇。單 agent 順序讀會爆上下文,而且讀到後面忘了前面。做法是按章節切成 8 份、8 個子 agent 並行精讀,各自產出結構化檔案,再彙總成全書總覽。長內容的上下文問題,切分加彙總比換更大的模型更管用。
按五個區域分組。標籤寫的是這件事能不能做——「做不了」的那幾條最值錢,它們決定了分鏡要繞著走。
每段 15 秒生成、約 12 秒內容,剪掉首尾再加速後落地約 8–10 秒成片。常規集目標 80–90 秒,對應 11–12 段;首集放寬到 2–3 分鐘,需要 16–22 段——首集要鋪世界觀和人設,長一點值得。
不能薄,也不能滿。薄了模型會先定住不動、後半段自己瞎編——實測給 15 秒配一句短台詞,結果前 7 秒發呆、後段編出提示詞裡沒有的台詞。塞滿 15 秒則動作趕,還會擠進要剪掉的首尾區。
預設行為是先給一段 establishing ramp:角色站定、環境鋪墊,動作要 5 秒後才真正開始。15 秒的條子裡丟掉 5 秒,等於三分之一預算打水漂。
生成出來的動作天生偏慢。打戲這類滿內容條 2 倍速、對白條 1.5 倍速、靜態和短內容原速。這一步要在寫提示詞時就算進時長裡,不能等剪的時候才發現節奏拖。
走、坐、寫字、夠物、遞東西這類日常動作能連貫完成,品質還不錯。但揮劍、連招、蓄力這類武打招式一律變成站樁——人杵在那不動。所以文戲正常寫動作,打戲必須換一套寫法(見第 13 條)。
誰放在第一張參考圖的位置,誰就是畫面主體和說話人。寫名字沒用,模型認的是圖序。按這個規則來不會串臉。
有台詞的鏡頭只留一個口型——說話人單獨一張臉,或者同框但對方閉嘴。兩人兩句必崩,這是全劇最高頻的崩點,沒有例外。
同一個角色分幾條生成,嗓音會不一樣。要聲線統一只能在剪輯階段整集重新配音,生成側無解。
角色、坐騎、法寶這類獨特複雜的實體必須掛圖;跨集出現或作為戲眼的道具也必須掛圖——純靠文字描述,一把木劍會漂成金屬劍。一次性的簡單道具(食物、包袱、字條)文字帶過即可。特寫鏡頭也要帶場景圖鎖住背景。
把純色底的角色卡放在第一位,模型會把那塊純色底當成背景帶出來,整個場景丟失。實測一條劍雨鏡頭因此背景全無。
畫面裡出現中文必然亂碼,一律交給後期加字幕貼圖。手部大特寫是崩壞率最高的畫面,焦點要挪到臉上,手降到畫面下緣虛化處理。
寫「臨水涼亭」,生成出來的亭子建在水中央、台階伸進水裡、沒有岸。「臨水/湖畔/依山」這類文學化方位詞,模型統統理解成懸空或泡在水裡。
模型強在物體運動和特效,廢在人物武打。所以主角立而不動(正好符合宗師人設,順帶避開站樁問題),動作全部交給飛劍、御物、雷光特效和敵人。
被攔過三次,每次的教訓都不是「這個詞不能用」,而是「這層關係不能拍」。把人比作牲畜貨物的寫法會被判成人口買賣;挾持加限制自由的台詞組合會被判非法拘禁;半寫實的人臉參考圖會被判成真人素材。
兩段實拍,都無刪減。一段打戲、一段文戲——正好是模型最強和最弱的兩頭,上面那些結論就是被這兩類鏡頭逼出來的。預設靜音,點開有音效。
整段沒有一句台詞,主角從頭到尾站在岩石上沒有移動過。所有動作都交給木劍、黑色劍氣和妖獸——這就是「御物流」在成片裡的樣子。
武打招式讓模型自己演,人物一定站樁。承認這一點之後,把動作全部轉移到可以「飛」的物體上,再用特效遮住所有接觸點——難度就從模型最弱的地方,挪到了它最強的地方。
和打戲相反的一類考驗:三個人同框、有來有回的對白、九條毛尾巴同時在動。這幾樣單拎出來都是高崩率項,能同時立住靠的是一條死規矩——一條裡只讓一個人開口。
多人同框最容易崩在口型上——兩個人各說一句必崩,臉會互相漂移。解法不是寫更細的提示詞,是改設計:有台詞的鏡頭只留一個口型,其他人顯式寫「嘴唇緊閉」,把對話拆成一來一回兩條。情緒反差也一樣,靠切鏡完成而不是讓模型演——它給不了細膩的表情演變。毛髮反而不是問題,它屬於「物體運動」那一類,正好是模型的強項。
七步。每一步下面那行小字是踩過坑之後立的規矩——流程本身不難,難的是知道哪裡不能省。
成本模型、時長檔位、審核紅線、角色卡建了哪些、已驗證的失敗模式——每個新專案開工前填一次。約束是隱性知識,使用者自己往往也沒意識到,所以要逐條填空確認,別指望對方主動交代。
待確認的項主動問,不許猜
寫任何分鏡前先把本集劇情聊定。只查兩件事:邏輯通不通(每個事件有因果、動機成立、和前後集接得上)、跳不跳鏡頭(觀眾視角下沒有憑空出現或消失的人和物,位置轉移都有交代)。
拍板前不許先寫檔案——搶跑過一次,返工整集
分鏡資訊以段頭備註併入提示詞篇:段號 | 內容概述 | 風險檔·版數 | 段末銜接。一份檔案既能錄入生成佇列,人也直接看這份,不用維護兩套。
每段標風險級和命中清單第幾條,可覆核、可迭代
開頭一句風格宣告,場景獨立成自然段,參考圖寫成句子而不是標籤,正文按秒段分 3–4 拍(1 秒 / 2–6 秒 / 7–11 秒 / 12–15 秒),運鏡交回模型不要自己指定,硬性約束全部收進結尾的英文段落——英文直達生成層,不經翻譯損耗,還能繞開中文違禁詞的誤判。
模板是照抄跑通的成功案例定下來的,不是設計出來的
新集、新場景、新角色首次上陣,先單條注入、生成後當場看、通過再放下一條。確認這一集的寫法穩了,剩餘同類低風險段才批次排。
整集一次排隊,一旦有錯整批作廢,錯誤還會批次擴散。高風險段永遠單跑單看
影片統一改名為「集-段-版」,生成次數回填到覆盤表。這一列的數字就是下一輪校準風險分級的資料。
首尾各剪掉約 1.5 秒(開頭殘餘 ramp、結尾抖動),只留中間約 12 秒 → 按類型加速 → 段間硬切拼接 → 加中文字幕和貼圖 → 鋪音效。
不做轉場特效,一律硬切
崩掉的段進崩案表。某類「低風險」段反覆崩,就升級它的風險檔,清單跟著變準。新踩的坑按准入門檻分類:能說清物理原因的進崩案表,原因不明的先進實驗記錄觀察,攢夠 3 次再升級。
這一步是整套 SOP 能自我進化的原因,跳過它清單就是死的
喜劇效果和生成穩定性在這裡是同向的,別逆著來。笑點優先往兩個口袋塞:一是靈寵的反應鏡——單主體、一個動作(裝死、縮脖、翻白眼),成功率最高,截圖傳播率也最高;二是主角的口嫌體直——嘴上嫌棄但手上照做,全靠動作和視線,不依賴台詞,沒有口型風險。絕對不要往多人對白裡塞:三主體加對輪台詞是崩率最高的組合。
按次計費的模型下,每一段要不要多生成一版備選,是全片成本的主要變數。這張表回答的就是這件事。
甜文裡對話戲佔比高,全程 2 版等於成本翻倍。所以定了一條降級機制:雙人同框對白暫按高風險出 2 版,連續 3 集實測其重試率與低風險段持平之後,降為 1 版。其它高風險項同理——某類反覆不崩就降級。這條機制才是整個分級表的核心,沒有它,清單只會越加越長、成本越滾越高。
要看內容分:單人臉部特寫的點睛幀(回眸、睥睨)是模型強項,算低風險出 1 版;複雜動作、特效、多主體的點睛幀才算高風險出 2 版。把「重要」直接等同於「高風險」是最常見的浪費。
四次真實事故。選這四條是因為它們各自代表一類不同的失敗原因——修好一個 bug 不值錢,看懂它屬於哪一類才值錢。
臨水涼亭
亭子建在水中央,台階直接伸進水裡,畫面裡根本沒有岸
「臨水/湖畔/依山」在人類語言裡是相對位置,在模型那裡被解成絕對位置——臨水就是在水上。它沒有「岸」這個中間概念。
改寫成:建在什麼地面上 + 有什麼路通到它 + 水在哪個方向多遠,再把「水中建築、台階伸入水中」寫進排除項。
凡是靠讀者腦補補全的描述,模型都會用最字面的方式補全。空間關係必須寫成可測量的。
靈寵鑽回符紙裡
不但沒消失,還複製成了三隻
物體一旦入畫就會保留到最後一幀。「消失」這個動作模型演不了,它只會理解成「這個東西很重要,多畫幾個」。
一條裡只寫「出現」,「消失」交給下一段不入鏡或者剪輯切段完成。確實要在畫面裡收走,就拍一個沒有主體的近景特寫。
生成模型只會做加法。所有減法都得靠剪輯完成——這條改變了我寫分鏡的整個思路。
一隻靈禽(只有文字描述,沒掛參考圖)
被編成一隻毫不相干的水鳥,且每條長得都不一樣
沒有參考圖時模型不會承認自己不知道,它會從文字裡找最接近的常見物種直接頂上。
任何要反覆出現的實體,先做卡再寫它的戲。沒卡就不許入鏡。
AI 不會說「我不知道」,它會給你一個自信的錯誤答案。這在生圖和寫程式上是同一個毛病。
「看了很久很久」「紋絲不動」,結尾也沒寫「說話的過程」
跑出來一張靜態圖片,不是影片
靜止的描述堆積到一定密度,任務本身被判成了圖片任務。模型是按描述的運動含量決定輸出形態的。
三處必帶:開頭宣告這是一段有連續運動的影片、不是靜態圖;結尾句寫明「特寫誰說話的過程」或「跟拍誰的連續動作過程」;排除項加上「無靜止畫面、無定格」。靜止情緒改寫成帶過程的動作——「眼神一點點變化」「眉頭緩緩皺緊」。
你以為你在描述一個畫面,模型在統計這段文字裡有多少運動。寫法決定它把任務歸成哪一類。