想生成一張新圖,或用人物、服裝、物件與場景圖片組出新畫面?這篇文章整理 Qwen-Image-2.1 的重點特色,以及 Qwen-Image-2.1-Edit-10Ref-Toggles.json 在 ComfyUI 的操作方式。
文章目錄
它能做什麼?
Qwen-Image-2.1 將文字生圖與圖片編輯放在同一個模型系列能力中。官方介紹的視覺生成主體為 7B 參數,並支援最多十張參考圖;實際體驗仍取決於所用工作流程、模型版本與硬體。參考 Qwen 官方專案。
生圖特色
文字生圖與圖片編輯
可從文字描述建立畫面,也可上傳原圖,要求模型更換背景、調整服裝、保留角色特徵或重新安排構圖。
最多十張參考圖
讓不同圖片分別提供人物、商品、服裝、配件或場景資訊。提示詞要說明每張圖的用途,並清楚指出哪些元素要保留。
細節、光影與文字
官方強調材質紋理、肖像光影與字樣呈現的改進。海報或商品圖可指定字句、材質與鏡頭感;有精確文字需求時仍建議人工核對成品。
原生透明圖像
模型支援透明背景的 RGBA 生圖與透明圖編輯。要輸出透明素材,提示詞應明確寫出透明背景,並確認工作流程的輸出設定能保留 alpha。
特色依據:Qwen 官方說明。十圖參考與透明生圖是模型能力;實際可用選項以載入的 ComfyUI 工作流程為準。
Qwen 官方說明文件:繁體中文摘要
以下整理自 Qwen-Image-2.1 官方專案說明,涵蓋模型能力與官方範例參數;它們是使用參考,不等於本頁十圖工作流程已預設開啟全部功能。
文字生圖與既有圖片編輯
可以只輸入文字生成新圖,也可以提供一張或多張圖片進行編輯。官方的多圖示例將參考圖片清單交給模型,用文字描述人物與場景如何組合;最多支援十張參考圖。
能指定要改的區域
官方說明支援以圈選、塗畫標註或獨立遮罩指示局部編輯,也強調保留人物或商品特徵。這些局部控制需要相應的輸入方式;本文的十圖 workflow 主要提供圖片載入與文字指令。
生成與編輯 RGBA 素材
模型可生成透明背景圖片,也能編輯透明素材。官方建議在提示詞明確描述「這是有透明度的 RGBA 圖片」、「具有 alpha 通道、背景透明」;儲存時仍需確認輸出節點保留透明資訊。
原生 2K,依硬體調整
官方列出的範例尺寸包括 1:1 的 2048×2048、4:3 的 2400×1792、16:9 的 2752×1536,以及 9:16 的 1536×2752;官方 Diffusers 範例使用 40 步。尺寸與步數提高通常會增加運算與記憶體負擔。
短指令可先擴寫
官方另提供文字生圖及圖片編輯各自的提示詞改寫模型,用來把簡短要求擴寫成細節較完整的描述。這是選用的獨立工具,本文列出的三個基礎模型已足夠載入目前的十圖 workflow。
重複運算的設計最佳化
官方描述視覺生成主體為 7B 參數、32 層單串流 DiT,文字與參考圖由 Qwen3-VL 8B 編碼;前綴快取設計可重用文字與條件圖片資訊。實際生成速度仍受軟體實作、解析度及硬體影響。
官方 Diffusers 說明的預設範例是 2048×2048 / 40 步;本文搭配的 ComfyUI 編輯工作流程目前預設為 1024×1024 / 25 步。要嘗試官方較高尺寸,可在工作流程中自行調整,並留意顯示卡記憶體需求。
延伸閱讀:官方快速開始與尺寸範例 · 提示詞改寫說明 · 模型結構。模型使用及再散布條件請參考官方授權文件。
需要下載哪些模型?放在哪裡?
這份 Qwen-Image-2.1-Edit-10Ref-Toggles.json 預設選用以下三個模型檔。到 Comfy-Org 的 Hugging Face 模型頁下載,檔名保持原樣,依序放入對應資料夾即可。
① 主模型 · Diffusion model
qwen_image_2.1_int8_convrot.safetensors ↗
放置位置:C:\AI\ComfyUI\models\diffusion_models\
② 文字與圖片編碼器 · Text encoder
qwen3vl_8b_int8_convrot.safetensors ↗
放置位置:C:\AI\ComfyUI\models\text_encoders\
三個檔案放好後,重新啟動 ComfyUI,或重新整理模型清單,再載入工作流程。若出現找不到模型,先核對檔名、子資料夾與節點下拉選單。上面列的是這份工作流程目前預設選用的組合;Hugging Face 同頁也有 BF16 等其他版本,改用其他版本時須同步修改工作流程的模型選項,不必把所有版本都下載。
資料夾配置與檔名依據:Comfy-Org 模型說明;預設選用組合依據本文搭配的工作流程 JSON。
十張參考圖工作流程怎麼用
本文搭配的檔名是 Qwen-Image-2.1-Edit-10Ref-Toggles.json。這是使用 ComfyUI 官方 LoadImage 節點的自訂編輯版工作流程,畫面上固定顯示 01 至 10 個載圖節點;不是需要安裝 QwenImage21RefLoader 的版本。
-
載入工作流程。從下方 Google Drive 資料夾取得 JSON,將檔案拖入 ComfyUI,或使用載入工作流程功能開啟。
-
設定第 01 張主要圖片。第 01 個
LoadImage預設啟用,請先把預設佔位圖換成自己的圖片。 -
依需求開啟參考圖。第 02 至 10 張預設為 Bypass。選擇圖片後,點選該載圖節點並按
Ctrl+B切換啟用;再按一次可切回 Bypass。開啟的節點請確實指定有效圖片。 -
輸入提示詞並生成。說明每張啟用圖片負責的角色,再於 Qwen-Image-2.1 節點設定解析度、步數等參數並執行。參考圖越多、解析度越高,通常需要更多記憶體與時間。

Ctrl+B 啟用(再按一次切回 Bypass)。右側 Qwen-Image-2.1 節點會依實際啟用的節點順序,對應 image_1、image_2……。提示詞中的圖片編號依實際啟用的載圖節點順序連續排列。例如只啟用 01 與 03,兩張有效圖片在提示詞中依序是 <image1> 和 <image2>;原本的節點 03 不一定對應 <image3>。
基本設定:CFG、Steps 與解析度
Qwen-Image-2.1 節點本身也能調整生成參數:steps 可視硬體調整,抓 15~25 之間即可,步數愈多細節通常愈穩定,但速度也愈慢;cfg、sampler、scheduler 也都在同一個節點。
同一個節點還有一個 resolution 下拉選單,預設值是 0(Auto)——意思是直接沿用參考圖片的原始尺寸生成。如果參考圖是手機拍的高解析度照片(例如 4000×3000),保持 Auto 就會照著這個尺寸下去生成,很容易超出顯示卡記憶體而報錯或當機。建議手動把 resolution 改選 768,把生成尺寸固定在一個測試過、多數顯示卡都吃得下的安全範圍,除非你很確定參考圖尺寸夠小、記憶體也夠用。
若把 custom_size 打開(預設 false),才會改用下方「解析度選擇器」節點:用長寬比(例如 9:16)搭配百萬像素與倍數計算出實際寬高,接到 Qwen-Image-2.1 節點的 width/height。custom_size 保持關閉時,這兩個輸入不會生效,實際生成尺寸仍以 resolution 選單(含上面提到的 Auto/768)為準。

圖片引用語法與提示詞範例
口語上可以稱作「<image 1>、<image 2>」,但在目前 ComfyUI 的 Qwen-Image-2.1 實作與此工作流程中,實際標記寫法是沒有空格的 <image1>、<image2>。以下範例可直接複製到提示詞欄,再替換成自己的需求。
以 <image1> 為原圖。保留人物的臉部特徵、髮型、衣著與姿勢,只將背景改成黃昏海邊;光線方向自然一致,人物比例與畫面構圖維持穩定。
以 <image1> 的人物作為主角,保留臉部特徵與體型;參考 <image2> 的服裝款式與材質,讓主角穿上該服裝。背景採柔和的攝影棚光線,服裝貼合自然,人物身分保持一致。
使用 <image1> 的人物,並參考 <image2> 的場景設計,把人物放入該場景。保留人物原本的五官與服裝;融合光影與透視,畫面自然。
以 <image1> 的人物作為主角,保留其身分與髮型;穿上 <image2> 的外套,搭配 <image3> 的手提包;置於 <image4> 的街景中。產出自然、完整的全身時尚攝影,四張參考圖的角色不得混淆。
語法核對:ComfyUI Qwen-Image-2.1 tokenizer 會產生 <image1> 格式;Qwen 官方專案亦用無空格的圖片索引範例。
下載與延伸閱讀
本文搭配的工作流程
Qwen-Image-2.1-Edit-10Ref-Toggles.json
前往 Google Drive 資料夾尋找工作流程 ↗
此連結是資料夾入口,實際檔案與分享權限請以資料夾目前內容為準。
這篇文章已有 7 次瀏覽
發佈留言