上星期 HuggingFace 的趨勢榜單上,有一個名字悄悄爬到前面:Qwen-Image-2.1。一週內累積超過 2600 個讚、下載次數逼近 6 萬,而且社群還衍生出各種微調版本。很多人看到「又一個出圖模型」就滑過去了,但這次不一樣——它對中文提示詞的理解力,是目前開源圈子裡數一數二強的。

這篇文章要帶你從零開始,把 Qwen-Image-2.1 裝起來、跑起來、用得順手。不管你是設計接案族、電商小編、還是只是想在群組裡做張梗圖,讀完這篇你就能自己出圖,不必再花錢買點數。我們會依序講:怎麼選安裝方式、中文提示詞怎麼寫才會準、以及出圖常見的失敗狀況怎麼救。

Qwen-Image-2.1 到底是什麼?跟其他出圖模型差在哪?

簡單說,它是一個開源的文字轉圖像模型,權重放在 HuggingFace 上,任何人下載後都能在自己的電腦或雲端跑。它最大的特色有三個。

第一是中文原生理解。過去的開源模型多半是英文訓練為主,你用「一個穿旗袍的女生站在廟前」這種句子,它常常會把「旗袍」畫成日式和服、把「廟」畫成教堂。Qwen 系列本來就是中文語料餵大的,這種文化細節的準確度高出一截。

第二是文字渲染能力。做海報最痛的就是 AI 寫出來的字是鬼畫符。Qwen-Image-2.1 在招牌、包裝、標語這類含文字的場景表現明顯進步,簡單的中文短句有機會一次到位。

第三是生態系完整。除了官方版本,社群還推出了 GGUF 量化版,讓顯示卡記憶體沒那麼大的使用者也能跑。目前下載量最高的那個 GGUF 版本已經突破 106 萬次下載,可見需求有多真實。

對香港和台灣的讀者來說,這代表什麼?代表你終於有一個「聽得懂人話」的開源出圖工具。不用翻成英文、不用猜它有沒有懂,直接打中文就好。

怎麼安裝?三種方式挑一種適合你的

安裝方式取決於你手上有什么設備。以下三種,難度由低到高排列。

第一種:ComfyUI 搭配 GGUF 版(最多人選)

如果你已經有 ComfyUI,這是最快的路。到 HuggingFace 搜尋 Qwen-Image-2.1 的 GGUF 版本,下載對應的量化檔案(Q4 或 Q5 對多數人夠用),放進 ComfyUI/models/unet/ 資料夾。文字編碼器放 models/clip/,VAE 放 models/vae/。接著在 ComfyUI 裡載入官方提供的範例工作流,把模型節點指向你下載的檔案,就能跑。

建議顯示卡記憶體 8GB 以上選 Q5,6GB 左右選 Q4,4GB 就選 Q3 並把解析度降到 768×768。

第二種:雲端 GPU 租用(不想買卡的人)

到 RunPod、Vast.ai 這類平台租一張 RTX 4090,一小時大約 0.3 到 0.5 美元。開一個 PyTorch 環境,git clone 官方 repo,照 README 安裝依賴,十分鐘內能跑第一次推論。適合只想試水溫、不想投資硬體的人。記得用完就關機,不然會被計時收費。

第三種:直接用線上 Demo(最懶)

HuggingFace 的模型頁面通常有 Inference API 或 Space 可以試玩。免費額度有限,但拿來測試提示詞效果非常夠用。先用這個確認你喜歡它的風格,再決定要不要本地安裝。

安裝完之後,第一次跑建議先用最簡單的提示詞,例如「一隻橘貓坐在窗台上」,確認整條管線沒問題,再開始玩複雜的。

中文提示詞怎麼寫?四個讓出圖準確的技巧

很多人裝好之後卡在「為什麼我出的圖跟我想的不一樣」。問題通常不在模型,在提示詞。以下四個技巧,照著調整會差很多。

技巧一:主體放前面,修飾放後面。

不要寫「在一個風和日麗的下午,有一隻很可愛的橘色小貓,牠正慵懶地坐在木頭窗台上曬太陽」。這種寫法模型會抓不到重點。改成:「橘貓,坐在木窗台,午後陽光,特寫」。先講畫什麼,再講氛圍。

技巧二:具體名詞勝過抽象形容詞。

「漂亮的風景」是無效提示詞,「阿里山雲海,日出,層次分明的山稜線」才有效。模型沒有審美觀,它需要的是可以對應到訓練資料的具體元素。

技巧三:需要文字就明確寫出來,並用引號包住。

例如:一張手搖飲菜單,上面寫著「珍珠奶茶 65 元」。把要出現的字用引號標清楚,模型比較容易正確渲染。字數越少越準,超過六個字的標語失敗率會上升。

技巧四:負面提示詞處理常見雜訊。

在 negative prompt 欄位填入「多餘手指、扭曲臉部、模糊、浮水印、變形文字」。這幾乎是所有出圖模型的共通毛病,先擋掉能省下大量重抽的時間。

實際操作時,建議一次只改一個變數。先固定提示詞,換種子碼看變化;再固定種子碼,改提示詞。這樣你才能累積出「什麼詞會造成什麼效果」的直覺。

出圖失敗怎麼辦?五個常見狀況與解法

就算提示詞寫對了,還是會遇到各種怪狀況。以下是社群最常回報的五個問題。

狀況一:人物手指數量不對。 這是所有擴散模型的通病。解法是把人物比例縮小(例如改成半身或遠景),或在負面提示詞加強,也可以出圖後用修圖工具局部重繪手部。

狀況二:中文文字變成亂碼。 降低文字複雜度,一次只要求一個短詞。若還是不行,建議出圖後用 Canva 或 Photoshop 自己疊字,這比反覆重抽快十倍。

狀況三:畫面出現重複圖樣或鬼影。 通常是解析度設太高或步數太多。把 steps 降到 20 到 30 之間,CFG scale 維持 7 左右,通常會改善。

狀況四:出圖速度慢到想哭。 檢查是否用了 CPU 模式。若有顯卡,確認 PyTorch 安裝的是 CUDA 版本而不是 CPU 版本。這是最常見的效能殺手。

狀況五:風格跟你想要的不一樣。 加上風格關鍵詞,例如「電影感」、「扁平插畫」、「水彩」、「3D 渲染」。這些詞對模型來說是強烈的風格切換開關。

最後提醒一句:出圖是機率遊戲,同一組提示詞多抽幾次是常態。心態上把它當成「跟一個很有才華但偶爾脫線的助手合作」,你會用得開心很多。

重點回顧

Qwen-Image-2.1 是目前中文社群最值得試的開源出圖模型,中文理解與文字渲染都明顯進步。安裝有三條路:ComfyUI 加 GGUF 版最實用、雲端租 GPU 最省硬體、線上 Demo 最適合先試水溫。提示詞記住「主體優先、具體勝抽象、文字加引號、負面詞擋雜訊」四原則。遇到手指、亂碼、鬼影等問題,先降解析度與步數,再考慮事後修圖。

現在就打開你的 ComfyUI,用「一隻橘貓坐在窗台上」當第一張測試圖吧。出圖這種事,看十篇教學不如自己跑一次。

延伸閱讀

常見問題

Q: 我的電腦沒有獨立顯卡,還能跑 Qwen-Image-2.1 嗎?

A: 可以,但速度會很慢。建議改用雲端 GPU 租用服務,或先用 HuggingFace 上的線上 Demo 試玩。純 CPU 推論一張圖可能要等十分鐘以上,實用性不高。

Q: Qwen-Image-2.1 跟 Midjourney、DALL·E 比,哪個比較好?

A: 各有強項。Qwen 的優勢在中文理解、免費開源、可本地端執行與微調;Midjourney 的藝術感與整體質感仍較強。若你需要大量出圖、在意成本與隱私,Qwen 是更好的選擇。

Q: GGUF 版本要選 Q4 還是 Q5?差別在哪?

A: Q5 畫質較好但吃更多記憶體,Q4 較省資源但細節略遜。8GB 以上顯示卡建議直上 Q5,6GB 左右選 Q4,4GB 就選 Q3 並降低出圖解析度。

Q: 為什麼我出的圖每次都不一樣?可以固定嗎?

A: 這是擴散模型的正常特性。只要固定 seed(種子碼)並保持提示詞不變,就能重現同一張圖。想微調時,固定 seed 改提示詞,就能看出單一詞彙造成的差異。

Q: 商用可以嗎?授權怎麼看?

A: 開源模型通常有各自的授權條款,使用前務必到 HuggingFace 模型頁面確認。多數允許商用,但可能要求標註來源或限制特定用途,接案前先看清楚以免踩雷。