上星期 HuggingFace 的趨勢榜單上,有一個名字悄悄爬了上來——Qwen-Image-2.1,一週內累積超過 2800 個讚、下載量突破 8 萬次。與此同時,社群還有人把它做成「無審查」的 GGUF 版本,單週下載直接衝到 137 萬次。這個數字代表什麼?代表全世界的創作者正在用滑鼠投票:開源生圖模型,終於有一個能跟閉源巨頭正面對決的選手了。

如果你之前試過用 AI 生圖,卻老是遇到「中文字變成鬼畫符」、「手部像章魚」、「版權費用貴到不敢用」這幾個痛點,那今天這篇就是為你寫的。我會帶你從零開始,一步步把 Qwen-Image 2.1 跑起來,並且教你幾個香港、台灣使用者最實用的提示詞技巧。看完之後,你就能自己生成海報、商品圖、甚至帶中文字的社群貼文素材,完全免費、完全本地端。

Qwen-Image 2.1 到底是什麼?為什麼值得你花時間學?

先講結論:它是一個開源的文字生圖模型,最大亮點是「中文字生成能力」遠勝同級對手。

過去我們用 Stable Diffusion 或 Midjourney 生圖,只要提示詞裡牽涉到中文,出來的結果通常是亂碼、缺筆畫、或是乾脆變成日文漢字。這是因為多數模型的訓練資料以英文為主,對中文字形的理解不足。Qwen-Image 2.1 由阿里團隊開發,訓練資料中大量納入中文語料與字形結構,所以當你請它生成「週年慶五折」這種字樣時,它真的能一筆一畫寫對。

對香港、台灣的創作者來說,這個差異有多大?想像一下:你要做一張中秋節的月餅促銷圖,以前你得先用 AI 生出背景,再開 Photoshop 手動打字,來回修半小時。現在你只要一句話,連字帶圖一次出來。省下的不只是時間,還有訂閱製圖軟體的月費。

而且它是開源的。這代表你可以下載到自己的電腦、自己的伺服器,資料不外流,對處理客戶素材的設計師、行銷公司來說,這一點非常關鍵。

如何安裝 Qwen-Image 2.1?三種方法任你選

安裝方式取決於你的電腦等級。我把它分成三條路,你挑一條適合自己的走。

第一條路:ComfyUI(最推薦給進階玩家)。如果你已經在用 ComfyUI,直接到 Manager 搜尋「Qwen-Image」,安裝對應節點,再把模型檔案放進 models/checkpoints 資料夾即可。Qwen-Image 2.1 官方版本約 20GB 上下,建議顯卡 VRAM 有 12GB 以上再挑戰。若你的顯卡只有 8GB,可以改用社群製作的 GGUF 量化版本,檔案縮到 6-8GB,畫質損失有限,速度反而更快。

第二條路:Diffusers 套件(適合會寫 Python 的人)。打開終端機,先安裝環境:

pip install diffusers transformers accelerate torch

接著幾行 Python 就能跑:

from diffusers import DiffusionPipeline
pipe = DiffusionPipeline.from_pretrained("Qwen/Qwen-Image-2.1")
pipe.to("cuda")
image = pipe("一隻戴著聖誕帽的柴犬,背景是香港維多利亞港夜景").images[0]
image.save("output.png")

第一次執行會自動下載模型,之後就快很多。這種方式的好處是你可以寫成腳本,一次生成幾十張圖,做批次處理。

第三條路:線上試玩(零安裝)。如果你只是想先看看效果,HuggingFace 的 Spaces 上已經有人架好 Demo,打開網頁輸入提示詞就能生圖。缺點是排隊要等、有使用次數限制,而且不能商用。適合「先試水溫,喜歡再安裝」。

不管你走哪條路,記得先確認你的顯卡驅動和 CUDA 版本是新的,這是九成新手卡關的地方。

提示詞怎麼寫?中文生圖的四個實戰技巧

安裝好只是開始,真正決定成敗的是提示詞。以下四個技巧,是我實測兩週後整理出來的心得。

技巧一:中文字要用引號包起來。 這是最多人不知道的關鍵。當你要生成特定文字時,請這樣寫:一張促銷海報,上面寫著「限時三天」,紅色背景,金色字體。引號能讓模型明確知道「這是文字內容,不是描述」,生成正確率大幅提升。沒有引號的話,模型常常把字當成裝飾元素亂擺。

技巧二:描述順序會影響構圖。 Qwen-Image 對提示詞的順序相當敏感。建議公式是:主體 → 動作 → 場景 → 風格 → 文字。例如「一個穿西裝的上班族(主體),正在喝咖啡(動作),在台北 101 的辦公室裡(場景),寫實攝影風格(風格),牆上寫著『加油』(文字)」。照這個順序寫,出來的圖通常一次就中。

技巧三:善用「負面提示詞」。 如果你發現生成的手部老是怪怪的,可以在負面提示詞欄位加入 extra fingers, deformed hands, blurry text。這是老手和新手的最大差距——不是提示詞寫得多,而是知道要排除什麼。

技巧四:中文和英文混用效果更好。 我實測發現,用英文描述風格(例如 cinematic lighting, 8k, masterpiece),用中文描述內容(例如「廟宇屋簷、燈籠」),出來的品質最穩定。因為模型的風格詞彙庫還是英文最豐富,但文化元素用中文最精準。這個混搭法,是香港台灣使用者獨有的優勢。

實際案例:用 Qwen-Image 2.1 做一張月餅禮盒宣傳圖

講這麼多,我們來跑一個完整案例。假設你是一間香港餅店的小編,要為中秋節做一張社群宣傳圖。

第一步,打開你的介面,輸入提示詞:

高級月餅禮盒放在木桌上,旁邊有熱茶和燈籠,暖色調,
中秋節氛圍,商業攝影風格,盒子上寫著「中秋團圓」

第二步,設定參數:尺寸選 1024x1024(社群貼文最通用),步數 30,引導係數 7.5。這三個數字是多數情況的甜蜜點,不用每次都調。

第三步,生成後檢查中文字。如果「中秋團圓」四個字有筆畫錯誤,別急著重跑整張圖,可以把種子碼(seed)固定住,只微調提示詞再生成一次,這樣背景不會跑掉,只修文字。

整個流程熟練之後,從零到成品大約三分鐘。以前這種圖要外包給設計師,一張報價港幣三五百元跑不掉。現在你自己就能做,而且想改幾次就改幾次。

小提醒:如果你打算商用,記得留意模型授權條款。Qwen 系列多數採寬鬆授權,但不同版本細節不同,出圖前花五分鐘確認一下,能省掉後續麻煩。

延伸閱讀

常見問題

Q: 我的電腦只有 8GB VRAM,跑得動嗎?

A: 可以,但要改用 GGUF 量化版本。 社群已經有人把 Qwen-Image 2.1 壓縮成 6-8GB 的量化模型,畫質損失約一到兩成,肉眼不一定看得出來,但速度會快不少。安裝方式和一般版本類似,只是模型檔案不同。若連 8GB 都沒有,建議先用線上 Demo 試玩。

Q: 生成出來的中文字還是有錯字,怎麼辦?

A: 三個方向調整。 第一,確認文字有加引號。第二,把文字描述放在提示詞最後面,讓模型聚焦。第三,降低引導係數到 6 左右,有時候係數太高反而讓模型「過度發揮」。如果還是不行,就固定種子碼,只改文字部分重跑。

Q: Qwen-Image 2.1 可以用來做商業用途嗎?

A: 多數情況可以,但要確認授權版本。 Qwen 系列通常採 Apache 2.0 或類似寬鬆授權,允許商用。但社群修改的「無審查」版本授權可能不同,商用前務必看清楚。另外,生成的內容若有涉及商標、名人肖像,法律責任仍在使用者身上。

Q: 它跟 Midjourney、Stable Diffusion 比,差在哪?

A: 各有強項。 Midjourney 的藝術感和風格多樣性仍是最強,但中文字幾乎不行。Stable Diffusion 生態最豐富、外掛最多,但設定門檻高。Qwen-Image 2.1 的優勢在中文字生成、開源免費、可本地端運行,特別適合需要大量中文素材的亞洲創作者。

Q: 生成一張圖大概要多久?

A: 看你的硬體。 以 RTX 4070 為例,1024x1024、30 步,大約 15-25 秒。用 GGUF 量化版可以壓到 10 秒內。CPU 純跑的話可能要五分鐘以上,實務上不建議。

總結一下今天的重點:Qwen-Image 2.1 是當前開源生圖模型中,中文能力最強、最適合香港台灣創作者的選擇。安裝有三條路,提示詞有四個技巧,中文字記得加引號,風格詞用英文、內容詞用中文。這些都是我自己踩過坑之後整理出來的,你照著做,今天就能生出第一張滿意的圖。

工具再好,不動手都是別人的。現在就打開你的電腦,試著生成一張屬於你的作品吧。