為什麼同樣的模型,別人出圖就是比你好看?

上週 Qwen-Image 2.1 開源後,一週內在 HuggingFace 衝出近 2,900 個讚、超過 8 萬次下載,加上社群微調的無審查 GGUF 版本更被下載超過 145 萬次。很多人興奮地把模型裝進電腦,結果第一張圖出來卻有點失望——臉歪、手多一隻、背景糊成一團,心裡想:「不是說很強嗎?」

先說結論:Qwen-Image 2.1 真的很強,但它對「提示詞」的敏感度比你想像中高很多。 同一顆模型,提示詞寫得好跟寫得爛,出圖品質可以差到十倍以上。這不是模型問題,是溝通問題。

這篇文章會帶你從零開始,用五個具體可操作的技巧,把 Qwen-Image 2.1 的實力真正逼出來。不管你是用 ComfyUI、diffusers 還是線上版,這些原則都適用。讀完你會拿到一組可以直接複製的提示詞模板,以及一張「常見錯誤對照表」。

技巧一:先搞懂 Qwen-Image 2.1 聽得懂什麼「文法」

很多人把提示詞當成 Google 搜尋,丟幾個關鍵字就想要好結果:「貓、賽博龐克、高畫質」。這樣出來的圖通常很平庸,因為模型不知道這些詞之間的關係。

Qwen-Image 2.1 的文字理解能力是它最大的賣點之一,它其實讀得懂完整句子。所以正確做法是把提示詞寫成一句有主詞、場景、動作的描述,像在跟一位畫師下委託:

「一位穿紅色旗袍的年輕女性站在香港霓虹招牌的巷口,夜晚下著小雨,地面反射著招牌的光,電影感構圖,淺景深。」

對比一下關鍵字版本,你就會發現:句子版本給了模型「空間關係」和「光線邏輯」,這正是畫質差異的來源。記住一個原則——先寫「誰、在哪、做什麼」,再補「光線與氛圍」,最後才加「畫質與風格」。

技巧二:用「三層結構」拆解你的提示詞

我把實測有效的提示詞整理成三層結構,你可以直接套用:

第一層是主體(Subject):誰或什麼,加上外觀細節。例如「一位約 30 歲的亞洲男性,短黑髮,戴細框眼鏡,穿米色針織衫」。

第二層是環境與光線(Scene & Light):這是多數人漏掉、卻最能拉開差距的一層。例如「坐在採光良好的咖啡廳窗邊,午後斜射陽光,桌上有半杯拿鐵」。

第三層是風格與技術(Style & Tech):例如「35mm 底片質感,柔和散景,自然色調,高細節」。

三層寫齊,大約 60 到 100 個中文字就很夠了。不用寫成論文,Qwen-Image 2.1 對過長的提示詞反而會抓不到重點。我的經驗是超過 150 字之後,品質提升趨緩,甚至開始出現元素打架。

技巧三:負面提示詞不是萬靈丹,但要會用

新手最常犯的錯,是把所有想避免的東西全塞進負面提示詞:「模糊、變形、多手、多腳、低畫質、浮水印、文字、醜、錯誤解剖……」結果圖是乾淨了,但也變得呆板、沒有生命力。

比較好的做法是只針對這一張圖最可能出錯的地方下負面詞。例如你要畫手部特寫,就放「多餘手指、扭曲關節」;你要畫風景,就放「人物、文字、浮水印」。原則是:負面詞 3 到 6 個就夠,精準比數量重要。

另外提醒,如果你用的是社群微調版本(例如 GGUF 的無審查版),它的負面提示詞反應可能和原版不同,建議先用原版抓感覺,再換版本微調。

技巧四:善用「種子碼」與「重跑」找出最佳解

這是專業玩家和業餘玩家最大的分水嶺。很多人出圖不滿意,就狂改提示詞,改到最後自己都亂了。正確流程是:

  1. 先用一組提示詞跑 4 張,記下種子碼(seed)。
  2. 挑出構圖最喜歡的那一張,固定種子碼。
  3. 只微調提示詞裡的一兩個詞(例如把「午後陽光」改成「黃昏暖光」)。
  4. 重跑,比較差異。

這樣你才能知道是哪個詞造成了改變。Qwen-Image 2.1 對單詞替換的反應很明顯,固定種子碼做 A/B 測試,是提升出圖穩定度最快的練習方式。建議你開一個筆記本,記錄「提示詞 + 種子碼 + 結果評價」,一個月後你會有一套自己的資料庫。

技巧五:解析度與步數,別亂拉高

最後一個常被忽略的重點:參數不是越高越好。 很多人以為把步數(steps)拉到 50、解析度開到 4K 就會變漂亮,結果只是跑得慢又容易出現雜訊。

針對 Qwen-Image 2.1,實測建議是:步數落在 20 到 30 之間通常就收斂了,超過 35 邊際效益很低;解析度優先選模型原生支援的尺寸(例如 1024 系列),要更大就用放大工具二次處理,而不是硬開大尺寸。先求構圖與光線正確,再談放大,這個順序顛倒會讓你白忙一場。

給你一份可以直接用的模板

把上面五點整合起來,這是一份你可以立刻複製的通用模板:

主體:一位(年齡、性別、外觀、服裝)的(人物/物件) 場景:(地點),(時間),(天氣或氛圍) 光線:(光源方向與質感) 風格:35mm 底片/電影感/插畫風,柔和散景,自然色調,高細節 負面詞:模糊、變形、多餘手指、浮水印

先照這個模板寫三張圖,你會明顯感覺出圖穩定度上升。接下來就是累積經驗——每次出圖都問自己:「這次是哪一層寫得不夠清楚?」久而久之,你腦中會自動長出一套提示詞邏輯。

小結:提示詞是溝通,不是咒語

Qwen-Image 2.1 的開源讓高品質出圖不再是付費工具的專利,但工具再強,也要有人會用。記住三個核心:用完整句子描述空間關係、用三層結構組織內容、用固定種子碼做實驗。 這三件事做到了,你的出圖品質會立刻和大多數人拉開距離。

現在就打開你的工具,挑一個你一直想畫的畫面,套用今天的模板試一次。別怕出錯,出錯的圖才是你進步最快的教材。

延伸閱讀

常見問題

Q: Qwen-Image 2.1 提示詞要用中文還是英文? A: 兩者都可以,這顆模型的中文理解力特別強。建議用繁體中文寫主體與場景描述,風格與技術詞(如 35mm、bokeh)保留英文,通常效果最穩定。

Q: 為什麼我照著寫,出圖還是很差? A: 先檢查三件事:提示詞是否超過 150 字、是否忘了寫光線、負面詞是否塞太多。這三個是最常見的品質殺手,逐一排除通常就能改善。

Q: 步數和解析度要設多少才好? A: 步數建議 20 到 30,解析度優先選模型原生尺寸(如 1024)。要更大尺寸請用放大工具二次處理,不要一開始就硬開大圖,容易出現雜訊。

Q: 社群微調版和原版差在哪? A: 微調版通常放寬了內容限制,但對提示詞的反應可能不同。建議先用原版熟悉手感,再換版本微調,避免一次改太多變數而抓不到問題。

Q: 要怎麼穩定重現喜歡的圖? A: 固定種子碼(seed)是關鍵。記下滿意的種子碼,之後只微調提示詞中的一兩個詞重跑,就能穩定比較差異並複製風格。