Qwen-Image-2.1 使用指南|生圖特色與十張參考圖工作流程

作者:

分類:

ComfyUI · Image generation · Reference editing

想生成一張新圖,或用人物、服裝、物件與場景圖片組出新畫面?這篇文章整理 Qwen-Image-2.1 的重點特色,以及 Qwen-Image-2.1-Edit-10Ref-Toggles.json 在 ComfyUI 的操作方式。

文章目錄

  1. 它能做什麼?
  2. 生圖特色
  3. Qwen 官方說明文件:繁體中文摘要
  4. 需要下載哪些模型?放在哪裡?
  5. 十張參考圖工作流程怎麼用
  6. 圖片引用語法與提示詞範例
  7. 下載與延伸閱讀

它能做什麼?

Qwen-Image-2.1 將文字生圖與圖片編輯放在同一個模型系列能力中。官方介紹的視覺生成主體為 7B 參數,並支援最多十張參考圖;實際體驗仍取決於所用工作流程、模型版本與硬體。參考 Qwen 官方專案。

生圖特色

01 / GENERATE

文字生圖與圖片編輯

可從文字描述建立畫面,也可上傳原圖,要求模型更換背景、調整服裝、保留角色特徵或重新安排構圖。

02 / MULTI-REFERENCE

最多十張參考圖

讓不同圖片分別提供人物、商品、服裝、配件或場景資訊。提示詞要說明每張圖的用途,並清楚指出哪些元素要保留。

03 / TEXTURE & TYPE

細節、光影與文字

官方強調材質紋理、肖像光影與字樣呈現的改進。海報或商品圖可指定字句、材質與鏡頭感;有精確文字需求時仍建議人工核對成品。

04 / TRANSPARENCY

原生透明圖像

模型支援透明背景的 RGBA 生圖與透明圖編輯。要輸出透明素材,提示詞應明確寫出透明背景,並確認工作流程的輸出設定能保留 alpha。

特色依據:Qwen 官方說明。十圖參考與透明生圖是模型能力;實際可用選項以載入的 ComfyUI 工作流程為準。

Qwen 官方說明文件:繁體中文摘要

以下整理自 Qwen-Image-2.1 官方專案說明,涵蓋模型能力與官方範例參數;它們是使用參考,不等於本頁十圖工作流程已預設開啟全部功能。

01 / 同一模型,兩種任務

文字生圖與既有圖片編輯

可以只輸入文字生成新圖,也可以提供一張或多張圖片進行編輯。官方的多圖示例將參考圖片清單交給模型,用文字描述人物與場景如何組合;最多支援十張參考圖。

02 / 局部修改

能指定要改的區域

官方說明支援以圈選、塗畫標註或獨立遮罩指示局部編輯,也強調保留人物或商品特徵。這些局部控制需要相應的輸入方式;本文的十圖 workflow 主要提供圖片載入與文字指令。

03 / 透明圖

生成與編輯 RGBA 素材

模型可生成透明背景圖片,也能編輯透明素材。官方建議在提示詞明確描述「這是有透明度的 RGBA 圖片」、「具有 alpha 通道、背景透明」;儲存時仍需確認輸出節點保留透明資訊。

04 / 尺寸與步數

原生 2K,依硬體調整

官方列出的範例尺寸包括 1:1 的 2048×2048、4:3 的 2400×1792、16:9 的 2752×1536,以及 9:16 的 1536×2752;官方 Diffusers 範例使用 40 步。尺寸與步數提高通常會增加運算與記憶體負擔。

05 / 提示詞改寫

短指令可先擴寫

官方另提供文字生圖及圖片編輯各自的提示詞改寫模型,用來把簡短要求擴寫成細節較完整的描述。這是選用的獨立工具,本文列出的三個基礎模型已足夠載入目前的十圖 workflow。

06 / 模型結構

重複運算的設計最佳化

官方描述視覺生成主體為 7B 參數、32 層單串流 DiT,文字與參考圖由 Qwen3-VL 8B 編碼;前綴快取設計可重用文字與條件圖片資訊。實際生成速度仍受軟體實作、解析度及硬體影響。

官方範例與本文工作流程的差異

官方 Diffusers 說明的預設範例是 2048×2048 / 40 步;本文搭配的 ComfyUI 編輯工作流程目前預設為 1024×1024 / 25 步。要嘗試官方較高尺寸,可在工作流程中自行調整,並留意顯示卡記憶體需求。

延伸閱讀:官方快速開始與尺寸範例 · 提示詞改寫說明 · 模型結構。模型使用及再散布條件請參考官方授權文件。

需要下載哪些模型?放在哪裡?

這份 Qwen-Image-2.1-Edit-10Ref-Toggles.json 預設選用以下三個模型檔。到 Comfy-Org 的 Hugging Face 模型頁下載,檔名保持原樣,依序放入對應資料夾即可。

① 主模型 · Diffusion model

qwen_image_2.1_int8_convrot.safetensors ↗

放置位置:C:\AI\ComfyUI\models\diffusion_models\

② 文字與圖片編碼器 · Text encoder

qwen3vl_8b_int8_convrot.safetensors ↗

放置位置:C:\AI\ComfyUI\models\text_encoders\

③ 圖片解碼器 · VAE

qwen_image_2.1_vae_bf16.safetensors ↗

放置位置:C:\AI\ComfyUI\models\vae\

下載後的檢查

三個檔案放好後,重新啟動 ComfyUI,或重新整理模型清單,再載入工作流程。若出現找不到模型,先核對檔名、子資料夾與節點下拉選單。上面列的是這份工作流程目前預設選用的組合;Hugging Face 同頁也有 BF16 等其他版本,改用其他版本時須同步修改工作流程的模型選項,不必把所有版本都下載。

資料夾配置與檔名依據:Comfy-Org 模型說明;預設選用組合依據本文搭配的工作流程 JSON。

十張參考圖工作流程怎麼用

本文搭配的檔名是 Qwen-Image-2.1-Edit-10Ref-Toggles.json。這是使用 ComfyUI 官方 LoadImage 節點的自訂編輯版工作流程,畫面上固定顯示 01 至 10 個載圖節點;不是需要安裝 QwenImage21RefLoader 的版本。

  1. 載入工作流程。從下方 Google Drive 資料夾取得 JSON,將檔案拖入 ComfyUI,或使用載入工作流程功能開啟。
  2. 設定第 01 張主要圖片。第 01 個 LoadImage 預設啟用,請先把預設佔位圖換成自己的圖片。
  3. 依需求開啟參考圖。第 02 至 10 張預設為 Bypass。選擇圖片後,點選該載圖節點並按 Ctrl+B 切換啟用;再按一次可切回 Bypass。開啟的節點請確實指定有效圖片。
  4. 輸入提示詞並生成。說明每張啟用圖片負責的角色,再於 Qwen-Image-2.1 節點設定解析度、步數等參數並執行。參考圖越多、解析度越高,通常需要更多記憶體與時間。
Qwen-Image-2.1 十圖工作流程:Markdown Note 說明 Ctrl+B 開關張數,下方 01~10 號 LoadImage 節點以藍線連到 Qwen-Image-2.1 節點的 image_1 至 image_10
畫布左上角的 Markdown Note 會提醒操作方式:第 01 張預設啟用、02~10 張預設 Bypass;要用第幾張參考圖,就點選該 LoadImage 節點按一次 Ctrl+B 啟用(再按一次切回 Bypass)。右側 Qwen-Image-2.1 節點會依實際啟用的節點順序,對應 image_1、image_2……。
圖片排序規則

提示詞中的圖片編號依實際啟用的載圖節點順序連續排列。例如只啟用 01 與 03,兩張有效圖片在提示詞中依序是 <image1> 和 <image2>;原本的節點 03 不一定對應 <image3>。

基本設定:CFG、Steps 與解析度

Qwen-Image-2.1 節點本身也能調整生成參數:steps 可視硬體調整,抓 15~25 之間即可,步數愈多細節通常愈穩定,但速度也愈慢;cfg、sampler、scheduler 也都在同一個節點。

resolution 預設是 Auto,記得手動改成 768

同一個節點還有一個 resolution 下拉選單,預設值是 0(Auto)——意思是直接沿用參考圖片的原始尺寸生成。如果參考圖是手機拍的高解析度照片(例如 4000×3000),保持 Auto 就會照著這個尺寸下去生成,很容易超出顯示卡記憶體而報錯或當機。建議手動把 resolution 改選 768,把生成尺寸固定在一個測試過、多數顯示卡都吃得下的安全範圍,除非你很確定參考圖尺寸夠小、記憶體也夠用。

若把 custom_size 打開(預設 false),才會改用下方「解析度選擇器」節點:用長寬比(例如 9:16)搭配百萬像素與倍數計算出實際寬高,接到 Qwen-Image-2.1 節點的 width/height。custom_size 保持關閉時,這兩個輸入不會生效,實際生成尺寸仍以 resolution 選單(含上面提到的 Auto/768)為準。

Qwen-Image-2.1 節點基本設定:cfg、steps、sampler、scheduler、seed,以及下方解析度選擇器節點的長寬比、百萬像素與倍數設定
Qwen-Image-2.1 節點的 cfg/steps/sampler/scheduler,以及「解析度選擇器」節點的長寬比、百萬像素、倍數設定——這些都可依實際需求調整,不是寫死的參數。

圖片引用語法與提示詞範例

口語上可以稱作「<image 1>、<image 2>」,但在目前 ComfyUI 的 Qwen-Image-2.1 實作與此工作流程中,實際標記寫法是沒有空格的 <image1>、<image2>。以下範例可直接複製到提示詞欄,再替換成自己的需求。

單圖編輯 · 啟用 01
以 <image1> 為原圖。保留人物的臉部特徵、髮型、衣著與姿勢,只將背景改成黃昏海邊;光線方向自然一致,人物比例與畫面構圖維持穩定。
雙圖合成 · 啟用 01、02
以 <image1> 的人物作為主角,保留臉部特徵與體型;參考 <image2> 的服裝款式與材質,讓主角穿上該服裝。背景採柔和的攝影棚光線,服裝貼合自然,人物身分保持一致。
跳格使用 · 只啟用節點 01、03
使用 <image1> 的人物,並參考 <image2> 的場景設計,把人物放入該場景。保留人物原本的五官與服裝;融合光影與透視,畫面自然。
多圖組合 · 啟用 01、02、03、04
以 <image1> 的人物作為主角,保留其身分與髮型;穿上 <image2> 的外套,搭配 <image3> 的手提包;置於 <image4> 的街景中。產出自然、完整的全身時尚攝影,四張參考圖的角色不得混淆。

語法核對:ComfyUI Qwen-Image-2.1 tokenizer 會產生 <image1> 格式;Qwen 官方專案亦用無空格的圖片索引範例。

下載與延伸閱讀

本文搭配的工作流程

Qwen-Image-2.1-Edit-10Ref-Toggles.json
前往 Google Drive 資料夾尋找工作流程 ↗

此連結是資料夾入口,實際檔案與分享權限請以資料夾目前內容為準。

模型與官方範例

ComfyUI 相容模型檔與官方 workflow · Qwen-Image-2.1 官方專案與技術說明

本頁的 模型安裝清單已依此工作流程的預設設定列出三個必要檔案與放置位置。

↑ 回到目錄

這篇文章已有 7 次瀏覽

留言

發佈留言

發佈留言必須填寫的電子郵件地址不會公開。 必填欄位標示為 *