最近本機 AI 影片最讓我意外的,不只是畫質進步,而是「影片、中文對話、嘴型、音效、背景音樂」開始可以在同一個模型裡一起生成。MiniMax H3 開放權重之後,ComfyUI 很快就提供原生支援;再搭配 Director 類型的多段 Timeline 工作流,原本單次約 15 秒的限制,也可以改成多段生成、接續與輸出,實際上更接近一套可以反覆調整的 AI 影片工作台。
這篇文章從完全沒有 ComfyUI 經驗的角度開始,整理我目前實際使用 MiniMax H3 時最容易混淆的幾個概念:ComfyUI 是什麼、Workflow 到底是什麼、Hugging Face 的模型要下載哪幾顆、FL2VA 和 Ref2VA 差在哪、UNET/CLIP/LoRA/VAE 各自負責什麼,以及在 RTX 5070 12GB VRAM + 32GB RAM 這種並不算誇張的硬體上,怎麼做出比較實際的配置。
文章目錄
- 為什麼是 ComfyUI + MiniMax H3?
- ComfyUI 與 Workflow 是什麼?
- MiniMax H3 在紅什麼?
- Windows 安裝 ComfyUI
- Hugging Face:模型寶庫與下載方式
- MiniMax H3 檔案應該放哪裡?
- UNET:FL2VA、Ref2VA、INT8、W4A8
- CLIP/Text Encoder:三顆 Qwen 怎麼選?
- Video VAE 與 Audio VAE
- Turbo LoRA:8-step 與本文實際設定
- Workflow 放哪?Director 有什麼特色?
- Director Sampling:Steps、Sampler、Scheduler、Shift
- 如何突破單次 15 秒限制?
- 用 AI 幫每一段寫 Prompt
- 人物臉部一致性:多角度 Reference、0.5 MP 與後製
- RTX 5070 12GB + 32GB RAM 最佳化
- 常見問題與排查
- 分享:MiniMax H3 Director 加速版修正 Workflow
一、為什麼是 ComfyUI + MiniMax H3?
如果只是想按一個按鈕生影片,線上 AI 服務通常比較簡單;但一旦開始在意人物一致性、模型版本、解析度、參考圖、LoRA、取樣步數、長影片接續,或想要把同一套流程重複跑很多次,ComfyUI 的優勢就會出現。
MiniMax H3 則剛好補上了本機影片工作流裡很重要的一塊:它不是單純「畫面模型」,而是能理解文字、圖片、影片與音訊參照,並原生生成帶立體聲音訊的影片。官方開放權重版本支援 4–15 秒、24 FPS,中文也列在穩定支援的對話語言中。對需要中文旁白、主持人口播、角色聲音與現場音效的人來說,這點非常實用。
參考:MiniMax H3 Open Source、MiniMaxAI / MiniMax-H3。
二、ComfyUI 是什麼?Workflow 又是什麼?
ComfyUI 可以把它想成「AI 模型的節點式工作台」。不像傳統軟體把所有設定塞在一個視窗裡,ComfyUI 把每個工作拆成一個節點:載入主模型、載入文字編碼器、讀取圖片、建立 Prompt、Sampling、VAE 解碼、合成音訊、輸出 MP4,再用線把資料流接起來。
主模型(UNET / Diffusion Model)
↓
文字與參照理解(CLIP / Text Encoder)
↓
MiniMax H3 conditioning / latent
↓
Sampler
↓
Video VAE ──→ 影像
Audio VAE ──→ 聲音
↓
輸出 MP4
而 Workflow 就是這張「節點接線圖」的設定檔。ComfyUI 可以把節點、參數、連線與模型名稱記錄成 JSON。換句話說,Workflow 不是模型本身;它比較像一份可以重複執行的製作流程。
這也解釋為什麼網路上會看到很多「MiniMax H3 Workflow」:有人做最精簡版,有人做多段 Director,有人加 Prompt Enhancer,有人加第二次 Refine、Upscale 或 Turbo LoRA。真正的 H3 主模型可能一樣,但工作方式差很多。

三、MiniMax H3 在紅什麼?
MiniMax H3 的重點不是只有畫面變漂亮,而是把原本分散的任務放進同一套多模態生成架構。官方模型分成兩個最重要的路徑:
| 模型路徑 | 主要能力 | 適合情境 |
|---|---|---|
FL2VA |
文字、首幀、尾幀;可做 T2V、I2V、First/Last Frame | 畫面延伸、場景轉換、首尾控制、較自由的運鏡 |
Ref2VA |
多模態 Reference:圖片、影片、音訊 | 固定人物、固定服裝、聲音、動作或風格的跨片段一致性 |
官方 Ref2VA 最多可接受多張參考圖、參考影片與參考音訊,Prompt 內用 <Picture 1>、<Video 1>、<Audio 1> 指定各個參照的角色。這讓「同一位主持人連拍多個場景」變得比單純用第一張圖硬撐 60 秒更實際。
一個重要觀念:本機開放權重的主力輸出是 768p 級別;官方提到的 2K 是 H3-Regenerate-2K 路徑。做本機 Workflow 時,不要把「模型最高可到 2K」直接理解成 RTX 5070 可以舒服地原生跑 2K。
四、Windows 安裝 ComfyUI
ComfyUI 官方目前對一般新手優先推薦 Desktop 版;不過如果你想清楚掌握模型資料夾、Python、Custom Nodes 與備份,我仍然很喜歡 Windows Portable。本文以下用 Portable 的路徑示範。
1. 下載與啟動
到 ComfyUI Releases 下載目前適合 NVIDIA RTX 顯卡的 Windows Portable,解壓縮後執行 run_nvidia_gpu.bat。瀏覽器通常會打開 http://127.0.0.1:8188。
2. 更新 ComfyUI
MiniMax H3 是 2026 年才加入的原生功能,因此如果看到 Workflow 裡的 H3 節點全部變紅,第一件事不是亂裝 Custom Node,而是先更新 ComfyUI。官方 H3 支援從 0.30.0 起加入;實際使用時建議維持在目前穩定版。
3. Manager
新版 Desktop 已內建 Manager;Portable 的 Manager 也已進核心,但可能需要安裝 manager requirements 並用 --enable-manager 啟動。Manager 最常用來安裝 Director、KJNodes 或其他第三方節點。
五、Hugging Face:模型寶庫與下載方式
第一次看 Hugging Face 很容易被幾十個 .safetensors 嚇到。我的使用方式很簡單:把 Hugging Face 當成「模型 GitHub」。先看 Model Card,再看 Files;需要哪一顆就下載哪一顆,不要看到整個 Repo 就全部抓回來。
MiniMax H3 最重要的幾個來源:
| 來源 | 用途 |
|---|---|
| Comfy-Org / MiniMax-H3 | ComfyUI 官方整理版:UNET、Qwen3-VL、Video/Audio VAE |
| lightx2v / Minimax-h3-Turbo | |
| Kijai / MiniMax-H3-experimental | 實驗性 W4A8 等低記憶體版本 |
| AIMixer / ComfyUI_MiniMaxH3_Director | 多段 Timeline、連續生成與長影片工作流 |
推薦用 hf download,不要整個 Repo 全抓
Hugging Face 官方目前提供 hf CLI。安裝後可以只抓指定檔案,而且可以直接指定 ComfyUI 的模型資料夾。
# 安裝 Hugging Face CLI
pip install -U huggingface_hub
# 確認 CLI
hf --help
例如要把官方 Ref2VA、NVFP4 Qwen 與兩顆 VAE 一次下載到 D:\AI\ComfyUI\models:
hf download Comfy-Org/MiniMax-H3 ^
diffusion_models/minimax_h3_ref2va_pruned_int8_convrot.safetensors ^
text_encoders/qwen3vl_32b_minimax_h3_nvfp4_awq.safetensors ^
vae/minimax_h3_video_vae_fp16.safetensors ^
vae/minimax_h3_audio_vae_fp32.safetensors ^
--local-dir D:\AI\ComfyUI\models
下載新版 Ref2V 8-step Turbo LoRA:
hf download lightx2v/Minimax-h3-Turbo ^
minimax_h3_ref2v_turbo_8step_v1.0_768p_comfyui_bf16.safetensors ^
--local-dir D:\AI\ComfyUI\models\loras
選檔案的小技巧:如果你使用 ComfyUI,LoRA 檔名有 _comfyui_bf16 時,優先選 ComfyUI 版本,不要把同一顆 LoRA 的 Diffusers 版和 ComfyUI 版都下載。
六、MiniMax H3 必要檔案應該放哪裡?
MiniMax H3 不是「一顆 checkpoint 丟進 checkpoints 就好」的模型。它至少分成 Diffusion Model、Text Encoder、Video VAE、Audio VAE;如果要加速,再多一個 LoRA。
D:\AI\ComfyUI\
├─ models\
│ ├─ diffusion_models\
│ │ ├─ minimax_h3_fl2va_....safetensors
│ │ └─ minimax_h3_ref2va_....safetensors
│ ├─ text_encoders\
│ │ └─ qwen3vl_32b_minimax_h3_nvfp4_awq.safetensors
│ ├─ vae\
│ │ ├─ minimax_h3_video_vae_fp16.safetensors
│ │ └─ minimax_h3_audio_vae_fp32.safetensors
│ └─ loras\
│ └─ minimax_h3_ref2v_turbo_8step_v1.0_768p_comfyui_bf16.safetensors
├─ custom_nodes\
│ └─ ComfyUI_MiniMaxH3_Director\
├─ user\default\workflows\
├─ input\
└─ output\
Comfy-Org 的 MiniMax H3 Model Card 也直接列出相同的資料夾結構。Workflow JSON 本身則可以直接拖進 ComfyUI;若希望它永久出現在 Workflow 側欄,Portable 常見位置是 ComfyUI\user\default\workflows\。

七、UNET / Diffusion Model:FL2VA、Ref2VA、INT8、W4A8 怎麼選?
在 H3 Workflow 裡,最核心的「影片生成主模型」就是 Diffusion Model,很多人習慣口語上仍叫它 UNET。最容易混淆的是 FL2VA 和 Ref2VA 不是精度版本,而是不同任務路徑。
| 檔案 | 大約大小 | 特色 | 我會用在哪裡 |
|---|---|---|---|
minimax_h3_fl2va_pruned_int8_convrot.safetensors |
約 21 GB | ComfyUI 官方優化版;T2V / I2V / 首尾幀 | 景觀、運鏡、首尾畫面控制 |
minimax_h3_ref2va_pruned_int8_convrot.safetensors |
約 21 GB | ComfyUI 官方優化版;Reference-to-Video | 固定真人主持人、多模態 Reference |
minimax_h3_fl2va_pruned_w4a8_mixed.safetensors |
約 12 GB 級 | 實驗性 W4A8,顯著降低權重體積 | 12GB VRAM 機器的進階省記憶體方案 |
minimax_h3_ref2va_pruned_w4a8_mixed.safetensors |
約 12 GB 級 | Ref2VA 的 W4A8 版本 | RTX 5070 + 固定人物 Reference |
官方 INT8 ConvRot 比較省事,標準 Loader 就能走;W4A8 的優點是模型小很多,但它屬於實驗性格式,依你下載的來源可能需要特定 W4A8 Loader / comfy-kitchen build。不要看到檔案只有 12 GB 就直接拿標準 Load Diffusion Model 硬讀。
RTX 5070 12GB 的選擇:我目前實際使用的是官方 minimax_h3_ref2va_pruned_int8_convrot.safetensors,搭配 ComfyUI 動態 offload。相較 W4A8,INT8 檔案較大、搬運量也較高,但 Loader 相容性與整體穩定性較省事;對我目前 RTX 5070 12GB + 32GB RAM 的環境,這是實際採用的主模型。W4A8 則保留作為進一步節省記憶體的實驗性選項。
八、CLIP / Text Encoder:三顆 Qwen3-VL 到底差在哪?
MiniMax H3 的文字/多模態理解使用 Qwen3-VL 系列。這一層會讀 Prompt,也會理解 Reference image/video;它不是拿來「直接畫影片」的,但如果它沒理解你要誰做什麼,後面的 H3 也救不回來。
| 檔案 | 角色 | 是否必需 | 5070 + 32GB RAM 建議 |
|---|---|---|---|
qwen3vl_32b_minimax_h3_nvfp4_awq.safetensors |
ComfyUI 官方 H3 Text Encoder,約 15.7 GB | 是 | 首選;目前最實際 |
qwen3vl_32b_h3_ultra_uncensored_heretic_int8_convrot.safetensors |
社群版 H3 conditioning encoder,約 24.55 GiB;可視為「語言/Prompt 理解端的 uncensored 版本」,含 0–49 language layers + 完整 vision tower | 二選一 | 想降低前置語言模型對 Prompt 的拒絕/弱化時可用;但 32GB RAM 壓力明顯較大 |
qwen3vl_32b_h3_generation_tail_50_63_int8_convrot.safetensors |
50–63 layers + final norm + LM head,給相容的 Prompt Enhancer 做文字生成 | 否 | 不用 Prompt Enhancer 就不要載 |
Ultra Uncensored Heretic 到底「解禁」了什麼?
qwen3vl_32b_h3_ultra_uncensored_heretic_int8_convrot.safetensors 可以把它理解成「語言/Prompt 理解端的解禁版」,但要注意:它不是 MiniMax H3 影片主模型本身的解禁版。真正負責生成影片的仍然是 minimax_h3_fl2va... 或 minimax_h3_ref2va... 這類 Diffusion Model;這顆 Qwen3-VL 則位在前面,負責理解文字 Prompt、Reference image/video,並把條件資訊送給 H3。
這個社群版本是從標示為 ultra-uncensored-heretic/abliterated 的 Qwen3-VL-32B 衍生而來。實際意義比較接近:當 Prompt 包含一般 Instruct 模型可能自行拒絕、淡化、改寫或迴避的描述時,這個版本傾向更直接地把原始語意編碼成 conditioning。它主要改變的是「模型怎麼理解你的要求」,而不是替 H3 主模型憑空增加新的影片生成能力。
H3 的 conditioning 只需要 Qwen3-VL 前半段輸出,因此這顆檔案包含 token embedding、language layers 0–49 與完整 vision tower;H3 會使用第 49 層之後的 hidden state。後面的 language layers 50–63、final norm 與 LM head 被另外拆成 qwen3vl_32b_h3_generation_tail_50_63_int8_convrot.safetensors,只有在相容的 Prompt Enhancer 要把 Qwen 當成「文字生成器」時才需要載入。
| 你的目的 | 較適合的 Qwen |
|---|---|
| 穩定、低記憶體、一般 H3 影片生成 | qwen3vl_32b_minimax_h3_nvfp4_awq.safetensors:官方版,約 15.7 GB,對 32GB RAM 比較實際 |
| 希望 Prompt 不容易被前置語言模型自行弱化或迴避 | qwen3vl_32b_h3_ultra_uncensored_heretic_int8_convrot.safetensors:社群 uncensored conditioning encoder,但約 24.55 GiB,RAM 壓力較大 |
| 已經用 ChatGPT/Claude 寫好完整 Prompt | 兩者都不需要 generation tail;直接把寫好的 Prompt 送進 H3 conditioning 即可 |
所以「uncensored」不要誤解成 H3 整套都解鎖。它主要是減少 Qwen 前置理解層本身的語意限制;最後畫面能不能生成、人物與場景能做到什麼程度,仍取決於 H3 Diffusion Model、Reference、Sampling、LoRA 與 Workflow。本機使用時也要把記憶體成本算進去:以 RTX 5070 12GB + 32GB RAM 來說,我仍會把官方 NVFP4 Qwen 當成日常首選,Ultra Heretic 則視 Prompt 需求切換。
模型說明:Qwen3-VL-32B Ultra Uncensored Heretic — H3 ComfyUI INT8 ConvRot。
generation_tail_50_63 最容易被誤會。它不是第三種完整 CLIP,也不能自己取代前面的 Qwen Encoder;它只是把 H3 conditioning encoder 後面省略的語言層補上,讓相容節點可以把 Qwen 當成文字生成器來「改寫 Prompt」。
如果你已經用 ChatGPT、Claude 或其他 AI 先寫好每一段完整的 H3 Prompt,我反而建議把 Prompt Enhancer 關掉:15 秒很短,Prompt 已經包含鏡頭、動作、台詞與音效時,再二次擴寫很容易把一段塞得太滿。
九、Video VAE 與 Audio VAE:兩顆都要
| 檔案 | 大小 | 功能 |
|---|---|---|
minimax_h3_video_vae_fp16.safetensors |
約 5.21 GB | 把影片 latent 解碼成實際影像 |
minimax_h3_audio_vae_fp32.safetensors |
約 605 MB | 把音訊 latent 解碼成 H3 原生聲音 |
這兩顆不是「畫質版 vs 音質版」二選一。H3 是影音共同生成,所以要輸出有聲影片時兩顆都要接上。Video VAE 也不是主要用來保持人物臉部一致性;人物身份仍主要由 Ref2VA、Reference、Prompt 與 Sampling 共同決定。
十、Turbo LoRA:本文使用 8-step Ref2V Turbo
LoRA 在這裡不是拿來換畫風,而是用來加速 MiniMax H3 的 Sampling。本文目前分享的 Workflow 已統一採用 Ref2V 8-step Turbo。
| 項目 | 本文實際設定 | 用途 |
|---|---|---|
| 主模型 | minimax_h3_ref2va_pruned_int8_convrot.safetensors |
Ref2VA / Reference-to-Video 主模型 |
| Turbo LoRA | minimax_h3_ref2v_turbo_8step_v1.0_768p_comfyui_bf16.safetensors |
Ref2V 8-step Turbo,加速正式生成 |
| LoRA strength | 1.0 |
完整套用 Turbo LoRA |
| Steps | 8 |
與 8-step Turbo 對應 |
最重要的配對原則:Ref2VA 主模型搭配 Ref2V Turbo;本文分享版固定使用 8-step v1.0,Director 的 steps 也設定為 8。不要只改 Steps 而沒有確認 LoRA,也不要把 FL2V Turbo 套到 Ref2VA。
本文實際使用的 Turbo 檔案是:
minimax_h3_ref2v_turbo_8step_v1.0_768p_comfyui_bf16.safetensors
這顆 LoRA 放在:
ComfyUI\models\loras\
十一、Workflow 放哪?Director Workflow 的重點與特色
ComfyUI 的 JSON Workflow 可以直接拖到畫布,也可以用 Workflow → Open 開啟。Portable 如果要讓它長期出現在左側 Workflow 清單,我會放在:
D:\AI\ComfyUI\user\default\workflows\
如果使用 Desktop,user/workflows 的實際位置通常在使用者文件資料夾下;不同安裝方式不要硬套同一條路徑。
MiniMax H3 Director 是做什麼的?
一般 H3 Workflow 是「一段影片一張 graph」。Director 則把 H3 包成一個多段 Timeline 主控台:你可以新增 Clip、刪除 Clip、拖曳順序、指定每段秒數、選擇 T2V / I2V / FL2V / R2V,並決定片段之間要不要連續。
公開版 Director 目前支援多段 Timeline、FL2V、R2V、V2V / RV2V、Reference Groups、原生 Stereo Audio、Run Select、Refine / Upscale 與 Segment Continuity。以 Reference 模式來說,Common Params 可以放共用的人物 Reference,個別段落再額外加入圖片、影片或音訊;每段 Prompt 可以各自獨立。
安裝 Director
cd ComfyUI\custom_nodes
git clone https://github.com/AIMixer/ComfyUI_MiniMaxH3_Director.git
# 使用你自己的 ComfyUI Python 安裝 requirements
python -m pip install -r ComfyUI_MiniMaxH3_Director\requirements.txt
或使用 Manager → Install via Git URL 安裝上述 GitHub Repository,完成後重啟 ComfyUI。
我分享的「加速版修正」Workflow 使用重點
文末分享的 Workflow 主要不是要把 H3 改成另一個模型,而是把「模型 Loader + Turbo LoRA + Director Timeline + 影音輸出」整理成適合多段生成的工作方式。實際使用時,我會把它拆成三層理解:
| 層級 | 你主要要改什麼 | 通常不用一直動的東西 |
|---|---|---|
| 模型層 | FL2VA / Ref2VA、Turbo LoRA | Video / Audio VAE、Qwen Encoder |
| 主控台層 | 解析度、Steps、Shift、Segment Continuity、Run Select | 節點接線本身 |
| 內容層 | 每一段的 Reference、Prompt、Dialogue、Camera、Soundscape | 模型 Loader |
這樣做的好處是:要改劇情時,不用重新拉整張 ComfyUI Graph;只需要在 Director Timeline 裡增減片段,或讓 AI 重新產生其中一段 Prompt。
十二、Director 的 Sampling 設定:Steps、Sampler、Scheduler、Shift 是什麼?
Director 的進階 Sampling 區看起來很複雜,但本文分享的 Workflow 已經把主要參數配好。除非更換主模型、Turbo LoRA,或刻意做參數比較,日常使用時通常不需要一直修改。
| 設定 | 本文 Workflow 實際值 | 作用 | 平常是否要改 |
|---|---|---|---|
Steps |
8 |
Sampling 的主要迭代次數,也就是 H3 主模型反覆更新 Video / Audio latent 的輪數 | 通常不改;本文使用 8-step Turbo,因此維持 8 |
Sampler |
res_multistep |
決定每一個 Sampling step 如何利用模型預測來更新 latent | 通常不改 |
Scheduler |
simple |
決定各個 step 對應的 noise / sigma 分布 | 通常不改 |
Shift Video |
12 |
調整 Video latent 的 Sampling / noise schedule 分布 | 通常不改 |
Shift Audio |
3 |
調整 Audio latent 的 Sampling / noise schedule 分布 | 通常不改 |
Steps:最重要,也最容易被誤解
Steps 不是影片秒數,也不是 FPS。它代表一次影片生成過程中,Sampler 讓 H3 主模型進行幾輪主要 Sampling 更新。本文 Workflow 使用 steps = 8,也就是模型會依照 Scheduler 安排的取樣位置,反覆更新 latent 八次,再交給 Video VAE 與 Audio VAE 解碼成真正的影片與聲音。
一團雜訊
↓
Step 1 開始出現大概構圖
↓
Step 2 人物逐漸形成
↓
Step 3 動作、背景更明確
↓
Step 4
↓
Step 5
↓
Step 6
↓
Step 7
↓
Step 8
↓
Video / Audio latent
↓
VAE Decode
↓
影片 + 聲音
Steps 會直接影響生成時間。其他條件相近時,Step 數越高,主 Sampling 計算通常越久;但整體 Workflow 還包含 Qwen3-VL 編碼、Reference 處理、模型在 RAM / VRAM 之間的 offload,以及 Video / Audio VAE 解碼,因此總時間不會單純只由 Steps 決定。
本文不建議把 8 再任意拉高。目前 Workflow 已經搭配 minimax_h3_ref2v_turbo_8step_v1.0_768p_comfyui_bf16.safetensors。Turbo LoRA 與 Steps 應視為同一組設定;顯卡換得更快,通常只是讓相同 8 steps 跑得更快,並不代表應該自動增加 Steps。
Sampler:每一步怎麼走
H3 在每個 Sampling step 都會預測目前 latent 應該往哪個方向修正;Sampler 則決定如何利用這個預測得到下一步。本文分享 Workflow 的實際設定是 res_multistep,因此文章與下載的 JSON 都以這個值為準。
Scheduler:這 8 步分布在哪些 noise level
如果把 Sampler 理解成「每一步怎麼走」,那 Scheduler 就是「每一步安排在哪個 noise / sigma 位置」。本文使用 simple。
Sampler = 每一步如何更新 latent
Scheduler = 這些 step 如何分布在 noise / sigma schedule 上
Shift Video / Shift Audio
Shift Video 與 Shift Audio 不是影片位移、也不是聲音延遲幾秒,而是分別調整 Video latent 與 Audio latent 的 Sampling schedule。MiniMax H3 是影音共同生成,因此影片與音訊有各自的 shift 設定。
本文分享 Workflow 實際使用:
Steps = 8
Sampler = res_multistep
Scheduler = simple
Shift Video = 12
Shift Audio = 3
實務上最重要的結論:這五個值在本文 Workflow 中是一整組已經配好的 Sampling 設定。一般使用者真正比較常調整的是解析度、片長、Reference、Prompt、Segment Continuity 與要跑哪些 Segment;Sampling 參數本身反而不用一直動。
十三、如何突破 MiniMax H3 單次 15 秒限制?FL2VA vs Ref2VA 怎麼用?
先講清楚:Director 並沒有把 MiniMax H3 的「單次生成上限」破解掉。H3 每個 Sample 仍然是最多約 15 秒。所謂突破 15 秒,是在 Workflow 層把長影片拆成多個合法片段,分段生成後再接起來。
Segment 1:12 秒
↓ 取前一段尾端作為 continuity context
Segment 2:12 秒
↓
Segment 3:15 秒
↓
Segment 4:10 秒
↓
Director 合併輸出 → 49 秒影片
Director 的 Segment Continuity 可以把上一段生成尾端的動作/影音 context 帶進下一段,再把重複的 prefix trim 掉,因此視覺上比單純「四支 MP4 硬接」自然很多。公開版 Director 也允許自己增減 Clip,所以影片不必固定四段;兩段、六段、十段都可以,真正限制會變成你的生成時間與一致性,而不是 Timeline 長度。
長影片要用 FL2VA 還是 Ref2VA?
| 情境 | 較適合 | 原因 |
|---|---|---|
| 同一場景連續走動,重視上一段尾幀接下一段 | FL2VA | 首幀/尾幀控制直覺,畫面延伸自由度高 |
| 同一個真人主持人跨不同城市/不同場景 | Ref2VA | 每段都可以重新用人物 Reference 鎖身份 |
| 要同時參照人物、聲音、某種運鏡影片 | Ref2VA | 原生就是 Omni-reference 路徑 |
| 刻意硬切到全新場景 | T2V / 關閉 Continuity | 不要讓上一段尾端限制新鏡頭 |
以「同一位旅遊節目主持人,在羅馬連續四段介紹不同景點」為例,我會偏向 Ref2VA:每個 Segment 都共用同一張主持人 Reference,再讓 Director 維持必要的 continuity。這比只靠第一段尾幀一路傳下去,更能降低人物臉部隨片段慢慢漂移。
十四、最實用的一招:讓 AI 幫每一段寫 MiniMax H3 Prompt
Director 最大的價值之一,是「分鏡」和「模型」分開。你不需要自己在 ComfyUI 裡一句一句想台詞;可以先把整支影片的目的交給 ChatGPT 或其他 AI,請它規劃 N 段,再把每段 Prompt 貼進 Timeline。
我現在會用下面這種指令:
你是 MiniMax H3 Director 的分鏡規劃助手。
請把主題拆成 4 個 Segment,每段 10–15 秒。
同一位主持人必須維持人物一致性,Reference 使用 <Picture 1>。
每段只安排 1 個主要人物動作與 1–2 個主要運鏡,避免 15 秒內過度擁擠。
對話使用自然台灣華語,台詞長度必須能在該段時間內自然說完。
Prompt 本體用英文,但對話保留繁體中文。
每段輸出:
1. duration
2. integrated_multimodal_description
3. overall_soundscape
4. non_diegetic_music
5. continuity note
若這一段是新的硬切場景,也請標註 hard cut。
MiniMax H3 的 Prompt 可以把畫面、台詞與聲音一起描述。例如:
integrated_multimodal_description:
At 0.00 seconds, fully reference <Picture 1>.
The same female travel presenter walks slowly through a Roman street,
then stops and looks up at the Pantheon. Begin with a side tracking shot,
then reveal the building around the corner.
She says: <d>[Chinese] 我很喜歡羅馬的一點,就是不用特別找景點,走在巷子裡就到處都是歷史。</d>
overall_soundscape:
Natural Rome street ambience, footsteps, distant conversation,
clear synchronized Mandarin dialogue.
non_diegetic_music:
Soft elegant European travel-documentary music, low volume.
實務心得:每段 15 秒不要塞四個場景、五個動作、三句長台詞。長影片的正確做法不是把每段壓到極限,而是多加一個 Segment。

十五、人物臉部一致性怎麼改善?多角度 Reference、構圖、解析度與後製
MiniMax H3 的 Ref2VA 很適合固定真人主持人,但它本質上仍是 Reference conditioning,不是逐幀硬鎖臉。實際生成 10–15 秒口播影片時,如果人物轉頭、走動、嘴型變化很多,或鏡頭拉得太遠,臉部仍可能逐漸變軟、變糊或出現 identity drift。這時候最有效的改善方式,通常不是先把 Steps 往上加,而是先把 Reference 品質、人物在畫面中的比例、解析度與單段動作複雜度處理好。
1. 不要只放一張正面照:用 3 張不同角度 Reference
如果是固定旅遊節目主持人,我會準備三張同一人物的乾淨參考圖,放進 Common / Global References:
| Reference | 建議角度 | 主要用途 |
|---|---|---|
Reference 1 |
正面全身 | 建立整體身形、服裝、髮型與正面臉部基準 |
Reference 2 |
微側 30–45° 全身 | 補足轉頭、側臉與行走鏡頭時的五官資訊 |
Reference 3 |
另一側 30–45°,或清楚半身照 | 補另一側輪廓;半身照也能提供更多眼睛、鼻子、嘴型細節 |
三張圖最好維持同一髮型、相近妝感、接近的年齡感與服裝風格。臉部要清楚,不要被頭髮、墨鏡或帽沿遮住,光線也盡量均勻。對主持人類型影片來說,其中一張使用較近的半身 Reference,通常比三張都是遠距全身照更有價值,因為模型可以取得更多真正的臉部像素。
2. Reference 的臉要亮、乾淨、角度互補
- 臉部正確曝光,眼睛、鼻翼、嘴角與下顎輪廓清楚。
- 避免過強側光、逆光、墨鏡、帽沿遮臉。
- 正面與左右 30–45° 角度互補,不要三張都是幾乎相同姿勢。
- 如果角色設定是瘦高旅遊主持人,三張圖的身形比例也盡量一致。
3. 說話時讓臉佔畫面更多:Medium shot / Medium close-up
影片解析度固定時,人物離鏡頭越遠,臉實際分到的像素就越少。即使整張畫面看起來還不錯,遠景中的臉仍可能只有很小一塊,因此 H3 很難在每一幀都維持精細五官。
口播、介紹景點:
優先 → medium shot / medium close-up
純看風景:
可以 → wide shot
長時間邊走邊說:
不要讓人物一直維持在很小的遠景比例
尤其是有中文嘴型的主持人片段,嘴巴每一幀都在變,如果同時再做大幅轉頭、快速行走與強烈運鏡,identity drift 會更容易發生。
4. RTX 5070:0.4 MP 可以跑,但 0.5 MP 更適合人臉
本文原本分享的直式畫布為 480×864,約 0.4 MP。它的優點是速度快、12GB VRAM 壓力較低;但如果主要內容是固定主持人口播,人臉清晰度會比景觀更容易先碰到瓶頸。
| 級距 | 9:16 可用尺寸例 | 相對像素量 | RTX 5070 12GB 建議 |
|---|---|---|---|
| 約 0.4 MP | 480×864 |
1.00× | 速度優先、測試 Prompt、景觀片段 |
| 約 0.5 MP | 544×960(約 0.52 MP) |
約 1.25–1.30× | 固定主持人最值得先測的甜蜜點 |
| 約 0.6 MP | 依節點允許尺寸逐步往上 | 約 1.5× | 畫質再提升,但更容易碰到 VRAM / offload 臨界點 |
實務上我會先把同一個 Seed、同一組 Reference、同一段 Prompt 做 A/B test:
480×864 / 8 steps
vs
544×960 / 8 steps
如果 0.5 MP 的臉明顯更清楚,而且沒有因 low-VRAM offload 造成生成時間暴增,就把 544×960 當成主持人片段的日常設定。對目前這套 Ref2VA INT8 + Ref2V Turbo 8-step 而言,這通常比把 Steps 8 硬改成 12 或 16 更合理。
5. 臉很重要的片段,不一定要硬撐滿 15 秒
15 秒不是一定要用滿。人物需要長時間說話、轉頭、走動時,臉部 drift 會隨時間累積。若某一段特別重視主持人表情與嘴型,可以考慮拆成 8–10 秒,再新增下一個 Segment。Director 本來就適合用多段 Timeline 換取穩定度。
6. Prompt 裡明確寫「身份不變」,但不要只靠 Prompt
Preserve exact facial identity in every frame.
Keep facial proportions, eye shape, nose shape, mouth shape,
jawline, hairstyle, and apparent age unchanged.
Avoid facial drift during head turns and speech.
Favor medium close-up framing while speaking.
Keep the face sharp, well-focused, and evenly lit.
這類文字可以幫助模型理解優先級,但不能取代好的 Reference 與解析度。
7. 生成後還能做什麼?Face consistency 與 Face restoration 要分開看
Face consistency / identity pass 的目的是讓每一幀的臉更接近同一位 Reference;Face restoration 則主要改善已經生成但偏糊的眼睛、鼻子、嘴巴與皮膚細節。兩者不是同一件事。
ComfyUI 常見工具包含 FaceDetailer、ReActor、InstantID、IPAdapter FaceID、PuLID,以及 GFPGAN / CodeFormer 類 restoration。用在影片時要特別注意 temporal consistency:如果每一幀獨立修臉,反而可能產生閃爍。
對有中文口播與嘴型的主持人,不建議一開始就做很重的 face swap 或 restoration,因為可能把表情與 lip sync 修壞。比較穩妥的順序是:
MiniMax H3 Ref2VA 8-step
↓
輕度 face consistency / identity correction
↓
輕度 face restoration
↓
檢查 flicker、嘴型與表情
↓
最後再剪輯輸出
簡單結論:如果只是覺得臉稍微糊,優先順序建議是:三張互補角度 Reference → 說話時拉近人物 → 0.4 MP 升到約 0.5 MP → 必要時把 15 秒拆短 → 最後才做輕度 face consistency / restoration。
十六、RTX 5070 12GB + 32GB RAM:我會怎麼配?
RTX 5070 不是不能跑 MiniMax H3,但要接受一件事:12GB VRAM 不可能把所有 H3 組件都常駐顯卡。ComfyUI 會動態把權重在 GPU / RAM 之間搬動;真正影響體感的不只是算力,也包括「每次搬多少資料」。因此低位元模型與 Turbo LoRA 很有價值。
本文分享 Workflow 的 Ref2V 組合
| 角色 | 推薦檔案 | 理由 |
|---|---|---|
| 主模型 | minimax_h3_ref2va_pruned_int8_convrot.safetensors |
我目前實際使用的主模型。官方 INT8 ConvRot 相容性與穩定性較好,搭配 ComfyUI 動態 offload,在 RTX 5070 12GB + 32GB RAM 上較省事 |
| Text Encoder | qwen3vl_32b_minimax_h3_nvfp4_awq.safetensors |
日常首選:官方 H3 低記憶體 Qwen,約 15.7 GB;比 24.55 GiB Ultra Uncensored INT8 更適合 32GB RAM。若特定 Prompt 容易被前置語言層弱化,再切換 Ultra Heretic |
| Video VAE | minimax_h3_video_vae_fp16.safetensors |
必要 |
| Audio VAE | minimax_h3_audio_vae_fp32.safetensors |
必要;保留 H3 原生聲音 |
| Turbo LoRA | minimax_h3_ref2v_turbo_8step_v1.0_768p_comfyui_bf16.safetensors |
|
| Prompt Tail | 不載 | 用外部 AI 寫好 Prompt 時沒有必要多吃約 7 GB |
解析度與片長
本文目前分享的 Workflow 是直式 9:16、約 0.4 MP,實際輸出為 480×864、24 FPS。這是 RTX 5070 12GB 上很實際的起點。若影片主體是固定主持人、而且希望臉部更清楚,我會優先測試 544×960(約 0.52 MP);像素量約比 0.4 MP 多 25–30%,通常比直接增加 Steps 更值得。若再往約 0.6 MP 提升,VRAM 與模型 offload 壓力會更明顯,一旦跨過 12GB VRAM 的臨界點,生成時間可能因 RAM / VRAM 搬運而突然變慢。
Steps
本文分享版已統一使用 Ref2V 8-step v1.0 768p Turbo LoRA,因此 Director 的 steps = 8。對 RTX 5070 12GB 而言,若要改善速度,優先考慮解析度、片長、Reference 數量與 VRAM offload,而不是任意把 Steps 改低或改高。
目前分享 Workflow 的完整核心組合
主模型:
minimax_h3_ref2va_pruned_int8_convrot.safetensors
Text Encoder:
qwen3vl_32b_minimax_h3_nvfp4_awq.safetensors
Video VAE:
minimax_h3_video_vae_fp16.safetensors
Audio VAE:
minimax_h3_audio_vae_fp32.safetensors
Turbo LoRA:
minimax_h3_ref2v_turbo_8step_v1.0_768p_comfyui_bf16.safetensors
strength = 1.0
Task:
R2V
Steps = 8
Sampler = res_multistep
Scheduler = simple
Shift Video = 12
Shift Audio = 3
FPS = 24
畫布 = 480×864(9:16,約 0.4 MP)
Ref Max Size = 864
Clear VRAM between segments = true
SageAttention = 已旁路
32GB RAM 的現實
官方 21GB UNET + 15.7GB NVFP4 Text Encoder + 5.21GB Video VAE 已經超過 32GB 的「全部同時常駐」空間,更別說 Windows、ComfyUI 與暫存。因此 32GB 可以跑,但動態 offload 和 Page File 幾乎是必然。若 H3 會變成固定工具,升到 64GB RAM 對穩定性與減少磁碟換頁會很有感。
SageAttention 要不要裝?我不會把它列為 RTX 5070 的第一個優化項目。50 系列 Blackwell 的 SageAttention Wheel 與 Python / Torch / CUDA / sm_120 必須完全匹配,裝錯反而讓環境壞掉。先把「Turbo LoRA、NVFP4、INT8 主模型、合理解析度」做好,通常比冒險塞一顆不合版本的 SageAttention 更實際。
十七、常見問題與排查
| 症狀 | 優先檢查 |
|---|---|
| Workflow 打開整排紅色 Missing Nodes | 先更新 ComfyUI;Director 再確認 Custom Node 是否安裝 |
| 找不到模型 | 檢查 diffusion_models / text_encoders / vae / loras 是否放錯 |
| Ref2V 卻套 FL2V LoRA | 模型路徑與 LoRA 必須一致 |
| 8-step Turbo 生成結果異常 | 先核對 LoRA 是否為 Ref2V 8-step v1.0,並確認 Steps=8、Sampler=res_multistep、Scheduler=simple、Shift Video=12、Shift Audio=3 |
| 人物每段愈來愈不像 | 長片改 Ref2VA,每段重新帶同一份 Reference;不要只靠尾幀一路傳 |
| 人物臉部偏糊 | 先把口播鏡頭改成 medium shot / medium close-up;RTX 5070 可從 480×864 提升到 544×960(約 0.5 MP)測試 |
| 人物轉頭後變得不像 | Common References 改用正面 + 左右 30–45° 多角度同人物參考圖;必要時加入清楚半身照補臉部細節 |
| 台詞來不及講完 | 縮短台詞,或多新增一個 Segment,不要硬塞 |
| 記憶體爆掉、Windows 開始狂讀硬碟 | 降解析度/Ref image size、改低位元模型、關 Prompt Enhancer、確認 Page File |
WinError 10054 |
先看 ComfyUI log 是否 Sampling 仍持續;很多情況只是瀏覽器 WebSocket 斷線,不一定等於模型崩潰 |
十八、分享:MiniMax H3 Director 加速版修正 Workflow
如果你已經把 MiniMax H3 的主模型、Qwen Encoder、兩顆 VAE 與 Director 裝好,可以直接從這份 Workflow 開始。它的目的不是把所有設定鎖死,而是把多段 Director 的架構先整理好,之後可以自由新增/刪除段落、每段換 Prompt,並用 Reference 維持角色一致性。
MiniMax H3 Director 加速版修正 Workflow
下載後直接拖進 ComfyUI 畫布,或放進 ComfyUI\user\default\workflows\。這個資料夾裡有兩份 Workflow,依你要做「首尾幀生成 Video」還是「參考圖生成 Video」選對應的檔案:
下載資料夾:MiniMax H3 Director 加速版修正 Workflow
minimax_h3_director_fl2v_可自選LoRA.json— 首尾幀生 Video(Fl2V:指定起始幀與結束幀,中間畫面由模型補間生成)minimax_h3_director_r2v_可自選LoRA.json— 參考圖生 Video(R2V:用一張參考圖維持角色/場景一致性)
這兩份都改成可自選 LoRA,不再寫死單一 Turbo LoRA;預設仍使用 Ref2VA INT8 + Ref2V Turbo 8-step v1.0 768p,Director Sampling 設定為 steps = 8、sampler = res_multistep、scheduler = simple、shift_video = 12、shift_audio = 3,SageAttention 兩個節點均已旁路,並啟用段間清理顯存。第一次使用建議先跑一個 5–10 秒 Segment,確認主模型、Qwen3-VL、Video VAE、Audio VAE 與所選 LoRA 都能正常載入,再開始增加多段。
參考資料
- MiniMax:Open General Intelligence — MiniMax H3 Is Now Open Source
- MiniMaxAI / MiniMax-H3 Model Card
- Comfy-Org / MiniMax-H3:ComfyUI 模型檔與資料夾配置
- ComfyUI:MiniMax H3 Day-0 Support
- ComfyUI Workflow Templates
- ComfyUI MiniMax H3 Director
- LightX2V / MiniMax-H3 Turbo
- LightX2V:8-step 768p v1.0 release notes
- Kijai / MiniMax-H3-experimental
- Qwen3-VL H3 Ultra Heretic / Generation Tail 說明
- Hugging Face CLI Documentation
這篇文章已有 114 次瀏覽
發佈留言