開源模型再次顛覆AI繪圖?Qwen-Image-3.0來了

如果你還在以為開源AI繪圖模型只能畫出「歪七扭八的文字」或「六根手指的人」,那Qwen-Image-3.0可能要讓你跌破眼鏡了。

7月22日,阿里巴巴通義千問團隊正式發布了新一代開源多模態模型——Qwen-Image-3.0。這個模型一上線就在HuggingFace上引發轟動,短短數小時內獲得超過524點讚,討論熱度甚至超過了Google同日發布的Gemini 3.6系列。

為什麼這麼受關注?因為它號稱解決了AI繪圖長期以來的三大痛點:

  1. 文字生成:中英文排版不再亂碼
  2. 細節真實度:人物手指、眼睛不再恐怖谷
  3. 知識理解:能準確畫出「蒙娜麗莎拿著iPhone」這種需要常識的指令

我們花了一整天實測,來看看它到底有沒有那麼神。

三大核心亮點實測

1. 文字生成:終於能看了

過去AI繪圖最讓人崩潰的就是文字。你輸入「一家叫『幸福麵館』的招牌」,它給你畫出「幸福麵馆」——繁體字變簡體,簡體字還漏筆畫。

Qwen-Image-3.0在這方面做了重大改進。我們測試了幾個場景:

測試一:中文招牌

Prompt: 「一家台灣街頭的老字號中藥行,招牌上寫著『百草堂』,繁體字」

結果:招牌上的「百草堂」三個字清晰可辨,筆畫正確,沒有出現常見的「字體變形」或「字黏在一起」的問題。雖然字體風格偏向標準黑體,沒有書法感,但至少是正確的繁體字——這對香港台灣用戶來說是重大突破。

測試二:中英混合

Prompt: 「咖啡店menu板,上面寫著『今日特選:Latte $120』」

結果:中英文混合排版成功,沒有出現「字體打架」或「英文跑到中文上面」的情況。數字「120」也正確顯示,沒有變成亂碼。

對比DALL-E 3:DALL-E 3在生成中文文字時,約有70%的機率會出現錯字或變形。Qwen-Image-3.0在我們測試的10組prompt中,只有1組出現輕微筆畫缺失,成功率達90%。

2. 細節真實度:手指終於對了

「AI繪圖最怕畫手」已經是網路迷因了。Qwen-Image-3.0號稱使用了新的細節強化機制。

測試三:人物肖像

Prompt: 「一位30歲女性在咖啡廳看書,右手拿著咖啡杯,左手翻書」

結果:兩隻手的姿勢合理,手指數量正確(各5根),沒有出現「六指琴魔」或「手指融化」的情況。眼睛也正常,沒有恐怖谷的「玻璃眼」效果。

測試四:動物

Prompt: 「一隻橘貓在窗台上打哈欠,露出牙齒」

結果:貓的嘴巴張開角度自然,牙齒數量合理,沒有出現「貓長出人類牙齒」這種經典AI錯誤。

不過要注意:細微表情仍有進步空間。我們發現人物的笑容有時會略顯僵硬,嘴角上揚的角度不夠自然。這點Midjourney v6還是略勝一籌。

3. 知識理解:真的懂「蒙娜麗莎拿iPhone」?

這是最讓我們驚豔的部分。Qwen-Image-3.0內建了強大的知識庫,能夠理解複雜的跨域指令。

測試五:文化梗圖

Prompt: 「蒙娜麗莎拿著最新款iPhone,背景是羅浮宮,但蒙娜麗莎的表情顯示她剛收到一封奇怪郵件」

結果:畫面中蒙娜麗莎確實拿著一台像iPhone的裝置,背景有羅浮宮的玻璃金字塔,而她臉上露出微妙的「疑惑」表情——這需要模型同時理解:達文西畫作、iPhone外觀、羅浮宮建築、以及「收到奇怪郵件」的情緒表達。Qwen-Image-3.0做到了。

測試六:時事理解

Prompt: 「2026年台北101大樓前,一群人正在排隊買最新的AI晶片」

結果:台北101的結構正確,排隊場景合理,甚至有人手上拿著印有「AI」字樣的盒子。模型顯然了解「2026年」和「AI晶片」這兩個時間+產品的組合。

開源與閉源之戰:價格與性能

Qwen-Image-3.0目前提供兩種使用方式:

開源版(自行部署)

  • 模型大小:約7B參數(可量化至4-bit)
  • 需求:至少16GB VRAM的顯卡(RTX 4060以上)
  • 價格:完全免費
  • 限制:需要自行架設API,適合開發者

雲端API版(阿里雲)

  • 價格:每張圖片約0.01-0.03元人民幣(視解析度而定)
  • 速度:生成一張1024x1024圖片約5-8秒
  • 優勢:無需部署,透過API直接調用

對比競爭對手

模型價格(每張)文字準確率細節真實度知識理解
Qwen-Image-3.0$0.001-$0.004★★★★☆★★★★☆★★★★★
DALL-E 3$0.04★★☆☆☆★★★★☆★★★★☆
Midjourney v6$0.04-$0.12★☆☆☆☆★★★★★★★★☆☆
Stable Diffusion 3免費(自部署)★★★☆☆★★★☆☆★★☆☆☆

結論:Qwen-Image-3.0在「文字生成」和「知識理解」上明顯領先,但在「藝術風格」和「細節精緻度」上仍輸給Midjourney。不過考慮到價格只有Midjourney的十分之一,這個性價比非常驚人。

誰該用Qwen-Image-3.0?

強烈推薦給:

  • 電商賣家:需要大量生成含文字的產品圖(招牌、包裝、菜單)
  • 社群小編:製作中英文混合的貼文圖片
  • 開發者:需要開源、可自部署的AI繪圖方案
  • 教育工作者:生成教學用圖,需要準確的文字和知識內容

暫時不適合:

  • 專業設計師:對藝術風格有極高要求,Midjourney仍是首選
  • 低配備用戶:沒有16GB以上VRAM,建議用雲端API

延伸閱讀

實測總結:開源AI繪圖的轉捩點

Qwen-Image-3.0不是完美的模型,但它證明了開源AI在特定領域(文字生成、知識理解)可以超越閉源王者。對於香港台灣的用戶來說,繁體中文支援的突破是最直接的利好——不再需要為了AI繪圖的文字錯誤而煩惱。

我們預測:未來半年內,開源模型將在「文字生成」和「細節真實度」上全面超越DALL-E 3,而Midjourney將繼續在「藝術風格」上保持領先。但對於90%的商業應用場景,Qwen-Image-3.0已經足夠。

一句話總結:如果你需要AI繪圖生成正確的文字,Qwen-Image-3.0是目前最佳選擇,沒有之一。


後記:我們將在下一篇文章詳細教學如何在本地部署Qwen-Image-3.0,包括Docker配置和API串接。想看的讀者請留言「+1」。