用 MiniMax H3 做一段影片,和把幾段影片接成一個故事,是兩件不同的事。我做狗狗冒險、雪崩追逐和直升機救援時,最常碰到的問題是:角色換臉、物件突然多一個、人物換座位,或上一段明明還在跑,下一段卻先停下來。
這篇的核心做法很簡單:先決定每段影片的「開始狀態」與「結束狀態」,讓一段只完成一個主要動作,再寫出兩張畫面之間看得見的變化。前半以首尾幀模式為主,補上官方影片 Prompt 欄位與分鏡語法;第七章用《未完告白 II》當案例,說明這支 R2V 對話短劇為什麼重跑 4 次才成功。
- 上一段的尾幀 K2,可以直接用作下一段的首幀 K2。
- 如果 K1 到 K2 之間有太多事件,就增加 K1.5,拆成 K1→K1.5 和 K1.5→K2 兩段生成。
- Prompt 寫「動作怎麼發生」,比只寫「最後發生什麼」更有用。
▲ 多幕動作影片範例:留意每段交界處的動作與構圖。
▲ 第二支多幕影片範例。
一、先選對模式:首尾幀與參考素材各做什麼?
這篇主要使用 FL2VA(首尾幀生成):提供一張起點圖、一張終點圖,讓模型生成中間過程。若只提供首幀,則屬於從起點向後發展的 I2VA。Ref2VA(參考素材生成)則用圖片、影片或音訊參考角色、場景、動作與風格;參考圖不一定會原樣成為影片第一格。兩種模式的素材角色要分清楚。
| 想控制的事 | 優先做法 |
|---|---|
| 開場與結尾必須接近指定畫面 | 用 FL2VA,提供真正的首幀與尾幀。 |
| 沿用角色外觀、場景或動作風格 | 用支援參考素材的模式,確實上傳素材並指明用途。 |
| 只從一張圖開始往下演 | 用 I2VA,讓 Prompt 描述後續動作。 |
MiniMax H3 的單段長度依官方文件為 4~15 秒;需要更長的故事,就要安排多段、檢查銜接,再剪在一起。模式與時長仍以你使用的介面所提供的設定為準。
二、用關鍵幀拆動作:一段影片只解決一個主要變化
先把故事寫成一串看得見的狀態,而不是一長串劇情。例如狗狗要跑到懸崖邊並跳過去:
- K1:狗正在雪地奔跑,身體前傾,雪從後腳揚起。
- K2:狗已接近邊緣,仍在加速,前腳抬起,尚未停住。
- K3:狗在半空中躍過裂縫。
先生成 K1→K2,再生成 K2→K3。第二段直接沿用 K2 作首幀。K2 是兩段各自使用的端點圖,不是同一段 FL2VA 裡的第三張圖。這也是我修改複雜動作時最常用的拆法。
關鍵幀也要「帶著動勢」。如果 K2 畫成狗站穩在懸崖前,模型很可能讓第一段減速停下,第二段再重新起跑。把 K2 畫成跑步中的瞬間,並在文字裡寫清楚「腳步和鏡頭持續前進」,較容易得到連續感;實際結果仍要靠試生成與剪輯確認。
直升機救援也是同理。「敵人發射 RPG、直升機閃避、後方爆炸、女主角脫困、繩梯下降」塞在一段裡,容易跳過關鍵過程。我會拆成「發射與閃避」、「擦身而過與爆炸」、「脫困與繩梯下降」等不同段落,每段各有自己的首尾幀。
三、首尾幀 Prompt 範例:從 K1 走到 K2
下面是一段示意稿,假設已經在 FL2VA 介面放入兩張實際圖片,影片長度設為 6 秒。它用的是 MiniMax 官方指南所示的欄位結構:先標明兩張圖對應的時間,再寫畫面與動作、環境音、配樂。實際輸入時,圖片標籤必須對應你上傳的素材,不能只在文字裡寫一個不存在的 <Picture 1>。
How the reference pictures align with the target video — Picture 1 (from Shot 1) aligns with the 0.00-second mark of the target video; Picture 2 (from Shot 1) aligns with the 6.00-second mark of the target video.
integrated_multimodal_description: [Shot 1] Cinematic live-action. A medium-wide tracking shot follows the same brown dog running across a snowy ridge. At the first frame, its body leans forward and snow sprays behind its hind legs. The dog keeps running without pausing. Its front legs extend farther forward as it approaches the cliff edge. The camera tracks beside the dog at a steady speed, keeping the ridge and the direction of travel consistent. At the final frame, the dog reaches the exact pose and composition shown in Picture 2, still in motion.
overall_soundscape: Quick pawsteps crunch through snow. Wind crosses the ridge and the dog breathes rapidly as loose snow scatters behind it.
non_diegetic_music: N/A
拆開看:第一句交代首尾畫面與時間;integrated_multimodal_description寫鏡頭、主體、動作路徑與結尾狀態;overall_soundscape寫腳步、風聲等場景聲;non_diegetic_music寫觀眾聽得到、角色聽不到的配樂,沒有就填 N/A。這是官方文件的建議寫法,仍須配合所用工具的介面與模型版本調整。
寫動作時,我會用物理順序代替結果形容詞。例如 RPG 場面寫「發射後留下煙尾 → 直升機開始側移並傾斜 → 火箭從機側掠過 → 後方建物受擊」,比只寫「直升機帥氣閃過 RPG,發生大爆炸」清楚。運鏡則另寫「鏡頭從側面穩定追蹤」或「緩慢推近」,避免角色在動、鏡頭也亂轉。
四、最近補上的影片語法心得
1. 分鏡標籤要對應真正的剪點
官方格式從 [Shot 1] 開始;第一鏡不必加時間戳。只有需要切鏡頭時,才寫例如 [Shot 2] At 00:03.500, the camera cuts to...。時間必須落在影片長度內、依序往後。首尾幀補間通常先試單一連續鏡頭;如果只是鏡頭推近或跟拍,不必硬切成第二鏡。
2. 有台詞就把說話者、語言與原句綁在一起
多人對話使用 (S1)、(S2) 標記實際聲音來源;同一支目標影片按實際發聲順序編號,跨鏡頭沿用。它不是跨段固定聲線的保證。台詞放進 <d>,例如:
The pilot (S1) shouts: <d>[Chinese] 抓緊繩梯!</d>
後面的鏡頭仍沿用同一個說話者編號。狗叫、旋翼聲、爆炸聲屬於場景聲,不要把它們寫成角色台詞。短片對話也要留出發音所需時間;如果 6 秒內同時要閃避 RPG、爆炸、放繩梯和講兩句話,先拆段通常更容易控制。
3. 參考模式有自己的欄位
官方的完整參考模式指南使用 subject_definitions、summary、retention_analysis、detailed_description、overall_soundscape、non_diegetic_music,並用 <Subject N>、<Picture N>、<Video N>、<Audio N> 標示不同用途。它和上面的首尾幀範例不是同一套完整欄位,別把兩份範本硬混在一起。標籤也只有在相應素材真的提供給模型時才有意義。
五、常見失敗怎麼修?先改畫面,再改文字
| 生成結果 | 先檢查 | 優先修法 |
|---|---|---|
| 段落交界先停一下 | 尾幀是否是站定、落地或擺姿勢? | 改成動作中的關鍵幀;剪輯時比對前後速度,必要時修剪交界數格。 |
| 人物換臉、換衣服 | 是否真的提供角色參考?首尾圖是否一致? | 重做不一致的端點圖;把髮型、衣著、位置寫清楚。 |
| 多出一架直升機或一個人 | 畫面是否已暗示多個主體? | 先固定構圖,再寫 Exactly one rescue helicopter 等必要數量;刪除矛盾描述。 |
| 駕駛左右換位、繩梯浮空 | 兩張圖的座位、機艙方向、繩梯連接點是否相容? | 先修圖的空間關係;文字只補上「固定於艙門下方」等關鍵位置。 |
| 閃避或爆炸像瞬間移動 | 一段內是否塞了太多狀態? | 加一張中間圖,拆成兩段;寫清楚發射、運動、擦過、撞擊的順序。 |
「只有一架直升機」「不要多出路人」這類限制可以寫,但它們不能保證修復首尾圖本身的矛盾。尤其遠景中的駕駛員,本來就應維持自然比例;要求「遠景卻要看清大臉」容易把人物比例弄壞。
六、我現在的製作流程
- 列狀態:把故事拆成 K1、K2、K3……,每張只描述畫面上真正看得到的主體、位置與動作。
- 做圖與檢查:先確認角色衣著、飛行方向、座位、物件數量及光線能接上;端點有問題就先修圖。
- 逐段生成:每段用兩張端點圖,只寫一個主要動作及可觀察的過程;依動作需要選長度,不必每段都拉滿 15 秒。
- 檢查銜接:看最後一秒與下一段第一秒的速度、方向和角色位置。原樣沿用共用幀後,剪接時仍可修掉重複或停頓的幾格。
- 最後處理聲音:讓環境音、對話與配樂配合畫面節奏;必要時在剪輯階段補上跨段連續的聲音。
結論:多幕影片最值得先設計的是「狀態之間怎麼變」。首尾圖負責錨定畫面,Prompt 負責描述中間的物理過程,剪輯負責處理生成後仍然看得見的停頓。三者一起調整,才比較容易讓故事接成一口氣。
七、案例:《未完告白 II》為什麼重跑 4 次才成功
2026 年 10 月 7 日重新整理。前面六章談的是動作片與首尾幀。這一章改談參考素材生成(R2V)做的雙人對話短劇:《未完告白》三部曲的第二季《海岸線上的沉默》,從台北的雨騎到高雄的陽光,沿清水斷崖一路南下,長度約 226 秒(5433 幀,24fps)。
《未完告白》三部曲三季都用 MiniMax H3 的參考素材生成(R2V)製作,並以二採輸出 720p。點下表的片名可以直接看影片,右欄是本章中對應的說明:
| 三部曲 | 內容 | 對應本章說明 |
|---|---|---|
| 第一季|櫻花樹影裡的心事 | 高中畢旅:弘前公園櫻花、岩木山、足利花卉公園紫藤;鏡頭蓋是貫穿三部曲的伏筆。 | 第 4 項(鏡頭蓋狀態)、第 10 項(幀數與時長計算) |
| 第二季|海岸線上的沉默 | 大學遠距:台北的雨、東部海岸、清水斷崖到高雄的陽光,是本章的主要案例。 | 第 1、3、4、6、8、9、11 項,以及下方對照表 |
| 第三季|紫藤樹下的那封信 | 畢業後重回日本:錄取信與高雄工作的消息,最終章。 | 第 2 項(過肩鏡頭)、第 5 項(時間矛盾)、第 7 項(台詞情緒)、第 11 項(精簡) |
▲ 第二季《海岸線上的沉默》,本章案例影片;第一季、第三季的連結見上表。
這支影片重跑了 4 次才成功。回頭整理,造成重跑的不是同一個錯誤反覆發生,而是好幾類問題疊在一起:參考圖把不該出現的背景和人物帶進畫面、通話戲的手機與螢幕混亂、時間與天氣沒有延續、道具和車輛的物理狀態對不上、聲音與字幕出錯,以及 Director 節點悄悄載回舊資料。只要有一個鏡頭穿幫,那一段就得重做。
- 多數問題出在 Prompt 或參考素材本身互相矛盾,不是運氣不好。同樣的設定、同樣的 seed 再跑一次,通常解決不了。
- 重跑前先把問題對應到下表的某一類,修好描述、參考圖或資料,再按生成。
- 最浪費時間的是 Director 載入舊資料:以為改了,其實送出去的還是舊版本。
《未完告白 II》遇到的問題與修法
下表把第二季實際遇到的問題、原因與修法對照起來,括號內是下方詳細說明的項目編號。
| 實際看到的問題 | 原因 | 怎麼修 |
|---|---|---|
| 女主明明在高雄,背景卻是日本紫藤花架 | 角色參考圖的背景與站姿被帶進現在的畫面 | 角色圖只留臉、髮型與服裝;場景改用沒有人的空場景參考(第 1 項) |
| 公路畫面左右冒出男女主全身立繪 | 雙人構圖或立繪參考被當成畫面元素 | 清水斷崖段不再放人物立繪、雙人分割畫面或停車對話;鏡頭越遠,人物越小(第 11 項) |
| 女主拿兩支手機、兩邊螢幕都顯示女主,還把手機朝向鏡頭 | 分割畫面又同時要求兩支手機顯示動態對方 | 先分清語音、視訊與訊息;一般鏡頭讓螢幕朝使用者,必要時另做單支手機插鏡(第 3 項) |
| 回撥電話一開始就多出聽不懂的台詞 | 來電、查看紀錄、撥出與接通混在同一段 | 回撥段只留撥號等待聲,下一段才由對方說「喂」(第 3 項) |
| 通話前是黑夜,下一幕突然變白天 | 時間沒有被當成需要延續的狀態 | 夜景一路維持到明確的旅行蒙太奇,房間布局與窗外黑夜固定(第 6 項) |
| 高雄女主說「好熱」,路面卻是濕的 | 台北的雨景污染到高雄 | 兩地分開寫:台北下雨、路面濕;高雄強烈日照、柏油乾燥、陰影清楚;雨聲只來自男主那端(第 6 項) |
| 安全帽夾在肩上、掉了一頂又重新戴回、拉遠多出一頂;水瓶直立在行李袋上 | 道具狀態沒有逐段交接 | 每段寫清楚開始狀態、手部操作、結束狀態與下一段繼承(第 4 項) |
| 阿伯的車從海上出現 | 進場路徑沒有交代 | 從陸側車道進入,輪胎接觸柏油後停在路肩,海只在護欄外的背景(第 6 項) |
| 阿伯和男主聽起來像同一個人 | 兩人聲音描述太接近 | 阿伯寫成低沉、胸腔共鳴、略沙啞;男主是較高、平滑的年輕男聲(第 8 項) |
| 片尾中文字筆畫錯、對白字幕重複 | 模型畫繁體字不可靠,對白又同時燒進畫面 | 對白改用外掛 SRT;片尾字限定內容、位置與時點,另備後製字卡(第 9 項) |
| Prompt 明明改了,重新載入又變回舊的 | Director 節點同時存了好幾份時間軸 | 核對三份資料,重新載入並在畫面確認,再決定是否換 seed(第 10 項) |
需要說明的是,「檔案核對通過」「已重新生成」「成片驗收通過」是三件事。新的 Prompt 能修正描述矛盾,但表情、口型與聲音是否真的改善,仍要看生成結果。以下是這些修法的詳細說明,其中第 2、5 項主要來自第三季;這些都是這次製作的觀察與做法,不是 H3 必然遵守的規則。
詳細修法:從參考圖到 Director
1. 參考圖只供角色或場景時,要剝掉原圖的構圖指令
第二季女主明明人在高雄,卻跑回日本紫藤花架;另一次公路畫面左右還出現男女主全身立繪。這類結果提醒我:角色參考中的背景、站姿,甚至合照裡的第二個人,都可能被模型帶進現在的畫面。
我現在會分清楚角色圖、空場景圖、道具圖與構圖圖。角色圖只保留臉、髮型與服裝;宿舍、公寓、街道與海岸由當前場景決定。合照只存在紙張內,手機上的人只存在手機螢幕內。容易生出路人或分身時,先用沒有人的場景參考;不要一邊給雙人場景圖,一邊又要求複製一個前景人物。
The identity pictures supply faces, hair and clothing only. Their backgrounds and standing poses are not the current scene. Use the empty room reference for architecture. The two photographed faces remain inside the single paper print.
2. 過肩鏡頭真的會多出一個女主:不能只繼續堆「不要複製」
第三季第 7 節用了過女主肩膀看男主的構圖,實際結果卻是左側多出一個女主背影,長椅上又坐著完整的男女主。從構圖和 Prompt 對照看,比較像是模型把前景肩膀和參考圖裡的女主分成兩個身體;這是依畫面推斷,無法直接知道模型內部如何處理。即使原文已交代同一身份,也沒有完全避免。
這次我把相關三處過肩鏡頭改成側面雙人中景:男左女右,兩張側臉與手都讀得到,前景只有長椅和枝葉。它會少一點角度變化,但比錯誤的三人畫面好。先前備好的側面版本也因此成為實際修法;不要把「備援已寫好」誤當成「主版本已套用」。
A medium SIDE two-shot shows exactly TWO seated people, Ajie LEFT and Xiaoqing RIGHT, lamp BACKRIGHT. Both profiles and their hands are readable. The camera is beside the bench; the foreground contains only the bench edge and foliage.
3. 通話戲先決定螢幕是否需要被觀眾看到
第二季曾反覆出現女主拿兩支手機、兩人的螢幕都顯示女主,以及人物把手機朝觀眾展示。我的教訓是:雙人分割畫面已經讓觀眾看到兩端的人,再同時要求兩支手機各自顯示完整動態對方,很容易增加身份與螢幕的混淆。
- 語音通話:描述和台詞標記都用 audio call;接聽畫面可以使用對方靜態頭像,不能又要求 live 視訊。
- 視訊通話:各人只有自己的那一支手機。一般對話鏡頭讓螢幕朝使用者,不必兩個螢幕都朝觀眾;必要時另外做單支手機插鏡。
- 訊息:維持聊天介面,不在同一動作裡突然變成來電、接聽或視訊。
- 未接後回撥:分清「來電未接、鈴聲停止、查看紀錄、主動撥出、等待接通」。回撥段結尾可以只留撥號等待聲,下一段才由對方說「喂」,避免插入不明開場台詞。
- 看通話紀錄:用男主背後或肩後的視角,看他低頭操作自己的螢幕;別寫成向鏡頭展示手機。
4. 道具要有狀態表,尤其是安全帽、鏡頭蓋和水瓶
我看過安全帽夾在肩上、已戴好卻又掉一頂在地上、下一段突然重新戴回頭上,以及拉遠時多生一頂的結果。水瓶則曾直立在行李袋上,機車開走還保持那個不合理位置。
現在每段都交代開始狀態 → 手部操作 → 結束狀態 → 下一段繼承,連左右手一起記。拍攝騎車前,水瓶放進袋內、拉鏈關閉、袋子固定後座;安全帽戴好並扣好,行進中不再取下。重逢時只出現一頂:頭上 → 她雙手取下 → 右手持有 → 擁吻時右手鬆開 → 落地滾動 → 固定位置停住。後續拉遠只繼承停住的帽子,不能重演一次取帽或落帽。
| 物件 | 必須記住的狀態 |
|---|---|
| 相機/鏡頭蓋 | 戴蓋還是取蓋、哪隻手拿、背帶是否承重、放到哪塊地面、蓋子進哪個口袋。 |
| 安全帽 | 唯一一頂的持有人、戴好與扣帶狀態、落地後的位置;同一事件只發生一次。 |
| 水瓶/行李 | 收進袋內、袋口閉合、固定後座;騎車時不保留懸空或直立外露的擺拍狀態。 |
「放下」和「掉下」也不同。第三季男主必須右手托住相機,觸地、放穩、鬆手,兩手空了才抱她;不能相機還在半空就先擁抱。聲音也跟物理事件走:帽子落地一次輕扣聲,接著低音量短滾動;帽子停住後,下一段不再重播撞擊。
5. 時間矛盾比 Prompt 不夠強更值得先修
第三季曾要求男主 4.45 秒答完、走近抱起放下、額頭抵一秒,最後 7.0~7.2 秒走出畫面。問題是最後只有 0.2 秒,不是再加一個「自然」就能補救。我改成回答時開始靠近,放下後輕抵額頭,再轉向廚房跨一步;7.4 秒硬切直接省略剩下的路程,下一鏡才交代他已在廚房。
我現在先算台詞終點和剩餘動作時間,再決定刪動作、提前開始、用硬切省略,或拆成下一段。手牽著對方又拿著相機時,不能再要求同一隻手拍背;要先放開或放穩道具。拍照前後的鏡頭蓋與手位也同樣計算。
6. 夜景、雨天與紫藤,都要有持續的場景狀態
第二季通話前一幕是黑夜,下一幕卻變白天;第 2 幕兩地天氣對照,高雄女主說「好熱」,路面仍被台北雨景帶成濕的。我現在會把兩側分別寫清楚:台北下雨與濕路面,高雄則強烈日照、乾燥柏油、清楚陰影,雨聲只來自男主那一端。要從夜間到白天,放在明確的旅行蒙太奇,不讓同一通電話自行換時間。
女主連續的夜間電話戲,房間架構、桌子、窗戶與燈的位置要一樣,窗外維持黑夜。阿伯的車和機車也必須從陸側可見車道進入,輪胎接觸柏油,再停在路肩;海只在護欄外的背景,不能讓車跨過護欄從海上出現。
紫藤背景若只寫「same garden」,看起來可能像貼圖。我會交代小幅、不規則的葉片與花串擺動,樹幹、花架、長椅和路燈保持固定。結尾快速全開則另寫成電影式時間壓縮:既有花苞逐步開成花串,人物和運鏡維持正常速度,不加魔法光、粒子或突然換一棵樹。這種「開花+走路+拉遠+中文字」同段組合仍有生成風險,另備不綻放版本與後製字卡比較實際。
7. 台詞清單、語速和情緒,要分開控制
幾段成片曾在清楚的中文句子後面,多出聽不懂的聲音;無台詞片段也被語音辨識轉成莫名其妙的中文。這裡不能直接把辨識結果當成模型真的說了那句話:音樂、風聲或靜音都可能使 ASR 幻覺出字。我的做法是先聽原音,再比較自動辨識與指定中文結果,最後回頭查實際執行的 Prompt。
台詞寫成一份完整清單,標明每句開始、結束與說話者;情緒寫在台詞標籤之外,不把「哭著說」塞進要唸出的文字。無台詞鏡頭明確指定零額外人聲,而不是只寫一個籠統的 silent,連腳步、風與快門也一起禁掉。
Only the listed Mandarin turns are spoken. Do not add greetings, filler, repeated phrases, narration or a clipped final syllable. After each line, the speaker closes their lips and the other person listens. After the last line, retain only the specified ambience and physical sounds.
語速加快也不是一路趕到底。這次第三季把冗長解釋刪短,對白用連貫自然的說法;重要揭露後另外保留約 1.4~1.5 秒反應。沉默不代表人物當機,而是眼神停住、手微握、嘴唇閉合;也不應自動再補一聲「嗯」。
最近又修了兩句「其實我放棄了」「我也放棄了」:男主壓著心痛,重音落在「放棄了」,女主則含淚委屈、聲音微顫;聽的人要先震驚,才回應。不是只把音量加大,也不把犧牲演成責怪對方。這些新描述已寫入 Prompt,但情緒強度仍須以重跑後的畫面與原音驗收。
8. S1/S2 不是跨段鎖聲線的按鈕
我一開始也容易把角色編號和聲音編號混在一起。<Subject 1> 是視覺角色;(S1) 是聲音來源。依官方參考模式指南的說話者規則,一支目標影片按實際發聲順序編號,後續鏡頭沿用同一來源的編號。每一段獨立生成時,不能把組裝後整部片的角色序號當成模型已記住的聲音身份。
阿伯和男主曾聽起來像同一個人,因此我把阿伯寫成低沉、胸腔共鳴、略沙啞的年長聲音;男主是較高、平滑、不沙啞的年輕男聲。這是文字引導,不能保證跨段一致。若真的要使用聲音參考,必須提供介面支援的實際音訊,才定義 <Audio N>;沒有音檔就不能假裝已經鎖住聲線。
9. 對白用 SRT;畫面內中文字另外決定
這次我把講話字幕改成外掛 SRT,不要求模型直接把每句中文燒進影片。Prompt 仍保留語音台詞,只禁止畫面內對白字幕。若生成結果還有字幕,先查是否使用舊 Prompt、參考圖本身帶字,或描述裡仍有要求顯示台詞;禁止句也不能當作成功保證。
照片背面的手寫字、手機通話紀錄與片尾小字是另一件事。清晰的文字參考圖能提供形狀,但繁體字仍可能錯筆畫或變字。需要逐字可靠時,以後製疊字較可控;若選擇直接生成,就限定精確內容、位置、字級與出現時點,準備替換字卡。
第二季片尾是「走了很遠」先出現,隔一秒再出「才懂得怎麼靠近」;第三季是小字「有些話,不用等花開。」。只要畫面已經有這些字,就不在對白 SRT 重複疊一次。
依 Workflow 做出的 SRT,只是劇本時間版,不等於已和最終音軌同步。字幕時間用段落起始幀換算加上句內時間;若成片剪掉幾格、台詞提早或延後,必須再對最終影片校時。這次三集的字幕分開產生,也明確標示是否已做音軌校時。
10. JSON 改好,Director 還是舊的:要核對真正儲存與執行的資料
這次最容易浪費重跑時間的,不是文法,而是我的 Director 節點儲存了不只一份時間軸。只改 JSON 中看得到的 Prompt,具名資料或 R2V 工作區仍可能保留舊值;重新載入或切換模式後又恢復舊內容。
以下欄位是這次使用的 Director 節點實作,不是 MiniMax H3 官方要求所有 Workflow 都必須有的格式:
Director 主時間軸:widgets_values[11]
Director 具名時間軸:widgets_values_named.timeline_data
R2V 工作區:batchWorkspaces.r2v.segments
我現在同時核對主時間軸和具名時間軸是否相同、其中的 segments 是否與 R2V 工作區相同,再核對引用檔是否存在。原始檔名不變時尤其要重新載入;檔案內三份資料一致,仍不能證明目前已開啟的主控台已更新。還要在畫面查看第幾段、句子和段數,必要時核對真正送去生成的 Prompt,不能只看檔案修改時間。
時長也以實際幀數計算:總秒數=總幀數÷fps,下一段偏移累加實際幀數。這次第一季 3297 幀/24fps=137.375 秒,第二季 5433 幀=226.375 秒,第三季最新版 2688 幀=112 秒。Director 的輸入秒數可能會經節點量化轉換成幀數;因此先確認欄位是輸入值還是純顯示值,再判斷是否需要修改,不宜直接把所有 durationSec 都硬改成幀數÷24。
另外,這次 seed 是 20261007、模式 fixed。同樣的 Prompt 和設定用同樣 seed 重跑,通常不會得到充分不同的候選;若要比較不同樣本,就明確換 seed 或用介面支援的 randomize,並記下各版設定。修改 Prompt 後即使 seed 相同,輸入已不同,結果也可能改變;但不能把「多跑幾次」當成不同 seed 的替代。
11. 短劇的精簡,要留住動作高潮與結尾延伸
第三季從較長的草稿收成 112 秒,我最有感的不是單純加快 30~50% 語速,而是刪掉重複的「我知道/你怎麼知道」、重複解釋工作條件,以及一再說明同一個主題。省下時間留給揭露後的反應,和看得見的行動。
我保留的三個動作記憶點是:弘前戴著鏡頭蓋假拍一次;夜裡先放穩相機,再用雙手抱住她;翌晨取下蓋子、真正拍她一次。第二季則保留抵達高雄、取帽擁吻、低處看帽子與拉遠的收尾。觀眾需要看到抵達和反應,不只是聽到「我要去」。
清水斷崖的壯闊感也靠鏡頭安排:先在機車前方穩定倒退追拍,再後退上升,讓公路蜿蜒、山壁和太平洋逐漸占滿畫面,騎士變成小點。不要在同一段額外塞人物立繪、雙人分割畫面或停車對話;越遠的鏡頭,人物越小才合理。
- 角色與背景參考用途是否分清,畫面是否暗示了額外人物?
- 每個道具只有預期數量,左右手與前後段狀態是否能接上?
- 動作時間是否真的夠,硬切是否能省略不重要的移動?
- 台詞原句、發話區間與說話者是否完整;無台詞段是否禁止額外人聲?
- 語氣是否有重音、眼神和反應,而不只寫「傷心」或「驚訝」?
- 夜景、兩地天氣、房間布局與車輛進入路徑是否一致?
- Director 各份資料是否同步,主控台是否重新載入,seed 是否符合這次比較目的?
- 檔案核對完成後,是否另做成片的畫面、原音與字幕校時驗收?
我現在把 Prompt 看成一份可以驗收的拍攝指示:誰在何處、哪隻手拿什麼、先完成哪個動作、說哪一句、何時停,以及下一鏡要接什麼狀態。真正可靠的流程,是先消除描述矛盾,再生成、看原片、聽原音,最後才說這一版完成。
這篇文章已有 19 次瀏覽
發佈留言