上星期 Qwen 推出 Qwen-Image-2.1,短短七天在 HuggingFace 就衝破 2,400 個讚、下載量逼近五萬次,連 Comfy-Org 都同步上架了單檔案版本,下載量更誇張,直接突破 360 萬。很多人第一時間跑去玩「一句話出圖」,但真正讓設計師眼睛一亮的,其實是另一件事:這個模型開放了完整的微調空間,代表你可以用自己的作品、自己的風格,訓練出一個「只屬於你」的畫風模型。

這篇文章要帶你走完整條路:從為什麼要微調、怎麼準備資料集、到實際在 ComfyUI 裡跑 LoRA 訓練、最後出圖驗收。全程不需要寫程式,只要會整理資料夾、看得懂參數欄位就行。如果你是一直覺得「AI 出圖都長一樣」的設計師,或者想幫品牌做一套固定視覺的接案工作者,這篇會非常實用。

為什麼要自己訓練 LoRA,而不是一直改提示詞?

先講一個很多人踩過的坑。你可能已經試過在提示詞裡狂加「水彩風、日系、扁平化、莫蘭迪色」這種形容詞,結果每次出圖都像在抽獎,十張裡只有兩張能用。這是因為通用模型學的是「全世界的平均值」,它沒有你的品味,也沒有你客戶的品牌規範。

LoRA(Low-Rank Adaptation)的概念很簡單:不要動整個大模型,只額外掛一小塊「風格補丁」上去。這塊補丁可能只有幾十 MB,訓練時間從半小時到兩小時不等,但效果是——之後你只要打上觸發詞,模型就會自動往你的風格靠攏。對接案的人來說,這等於是把「跟客戶來回改十次」壓縮成「一次出四張,客戶挑一張」。

更實際的好處是穩定。當你幫一個餐飲品牌做菜單視覺,你不會希望這次的插畫是厚塗、下次變成線稿。LoRA 就是把風格鎖住的那把鎖。

資料集怎麼準備?20 張圖就有感

這是整條流程最關鍵、也最容易被低估的一步。很多人以為要餵幾百張圖,其實對 Qwen-Image-2.1 這種底子好的模型來說,15 到 30 張高品質圖片就能訓練出辨識度很高的風格。重點不在數量,在「一致性」。

具體做法是這樣:先開一個資料夾,把所有圖片統一裁成正方形(建議 1024×1024),統一色調與構圖邏輯。假設你想訓練的是「台灣復古柑仔店插畫風」,那這 20 張圖就都要有同樣的線條粗細、同樣的紙質感、同樣的配色邏輯。千萬不要一張厚塗、一張扁平、一張 3D,那模型會學到一團混亂。

接著是打標(tagging)。你要為每張圖寫一段描述,但不要把風格詞寫進去。例如圖裡是一隻貓坐在紙箱上,你就寫「a cat sitting on a cardboard box, simple background」,而不是寫「復古柑仔店風格」。風格這件事要留給觸發詞去學,這樣模型才會把「觸發詞 = 你的風格」牢牢綁在一起。觸發詞建議取一個模型原本不認識的怪詞,例如 mobdome_style 或 twretro_v1,避免跟既有詞彙打架。

小提醒:如果你手邊作品不夠,可以先用 Qwen-Image-2.1 生成一批「你自己風格的近似圖」,人工篩掉不像的,再拿去訓練。這是很多接案者的實戰做法,效率高很多。

在 ComfyUI 裡實際跑訓練:參數怎麼設?

現在進到實作。你需要的是 ComfyUI 加上對應的 LoRA 訓練節點(社群常見的是 kohya 系的節點包,或直接用獨立的訓練介面再接回 ComfyUI 出圖)。以下是給新手的保守參數,照著填就不容易炸:

第一步,載入底模。選 Qwen/Qwen-Image-2.1 或 Comfy-Org 上架的單檔案版本都可以,後者對 ComfyUI 使用者更友善。第二步,設定 learning rate,建議從 1e-4 開始,這是新手最安全的起點,太高會過擬合(出圖全部長一樣),太低則學不動。第三步,訓練步數設在 1,500 到 2,500 步之間,20 張圖的資料集大概跑 100 到 150 個 epoch 就夠了。

第四步,網路維度(network dim / rank)設 16 或 32。數字越大能學的細節越多,但也越容易記住雜訊,新手先用 16。第五步,記得開啟 mixed precision(fp16)節省顯卡記憶體,一張 12GB 的卡跑 1024 解析度的 LoRA 訓練是沒問題的。

整個訓練過程大概 40 分鐘到 1.5 小時,依你的顯卡而定。跑完之後你會得到一個 .safetensors 檔,通常只有 20 到 80MB,這就是你的風格資產。

出圖驗收:三個檢查標準

訓練完別急著發佈,先做驗收。第一,用觸發詞加一句簡單描述出圖,看看風格有沒有出來。第二,把觸發詞權重從 0.6 調到 1.0,觀察風格的強弱變化,找到最順眼的區間。第三,故意出一張訓練集裡沒有的主題,例如你訓練的是「柑仔店插畫風」,那就叫它畫「一隻在捷運上的貓」,如果風格依然穩定,代表模型是真的學會了風格,而不是死背圖片。

如果出圖發現臉部崩壞或構圖重複,通常是過擬合了,回頭把 learning rate 調低、步數減少再重跑一次。這種來回調整是正常的,別氣餒。

香港台灣讀者的實戰應用場景

對香港的接案設計師來說,這招特別適合做「系列視覺」——例如一個月要出 20 張社群貼圖,風格必須統一,以前要一張張手繪,現在訓練好 LoRA,量產速度直接翻好幾倍。對台灣的內容創作者來說,則很適合做個人品牌:你的 YouTube 封面、文章配圖、周邊商品全部套同一套 LoRA,讀者一眼就認得出是你。

甚至小型電商也能用:把自家商品的攝影棚風格訓練成 LoRA,之後拍新品只要隨手拍,再讓模型轉成統一風格,省下重拍的成本。

重點回顧

記住三件事:資料集重質不重量,20 張一致性高的圖勝過 200 張雜圖;觸發詞要用模型不認識的怪詞,風格才綁得緊;參數從 learning rate 1e-4、rank 16 這種保守值開始,先求穩再求好。LoRA 不是什麼高深技術,它更像是幫你的 AI 裝上「你的品味」的一個開關。今天就把手邊最滿意的 20 張作品整理出來,試著跑一次看看,你會發現 AI 出圖終於不再像抽獎了。

延伸閱讀

常見問題

Q: 訓練 LoRA 需要很貴的顯卡嗎?

A: 不用。Qwen-Image-2.1 的 LoRA 訓練在 12GB 顯卡上就能跑 1024 解析度,一般電競筆電或中階桌機都應付得來。如果真的不夠,也可以先用雲端 GPU 按小時租用,跑一次通常花不到一杯咖啡的錢。

Q: 我只有 10 張圖,這樣夠嗎?

A: 勉強可以,但建議至少湊到 15 張。如果作品真的不夠,可以先用 Qwen-Image-2.1 生成一批同風格的圖,人工篩選後補進資料集。重點是這 10 到 15 張的風格要高度一致,寧缺勿濫。

Q: 為什麼我訓練完,出圖風格還是不明顯?

A: 最常見的三個原因是:觸發詞權重設太低(試著從 0.8 開始)、訓練步數不足(提高到 2,000 步試試)、或者資料集風格本身就不統一。先回頭檢查資料集,通常問題都出在這裡。

Q: 訓練好的 LoRA 可以商用嗎?

A: 取決於你用的底模授權與訓練素材來源。Qwen-Image-2.1 的授權條款請以官方公佈為準;另外,如果你是用別人的作品當訓練素材,商用前務必確認版權。用自己原創作品訓練最安心。

Q: 一個 LoRA 可以同時學多種風格嗎?

A: 不建議。一個 LoRA 對應一種風格,效果最乾淨。想同時擁有水彩風和像素風,就分別訓練兩個 LoRA,出圖時再切換或疊加使用,這樣控制起來最靈活。