Muse-Glimmer實測|免費打贏Midjourney?

Meta 上星期靜靜在 HuggingFace 放出開源圖像模型 Muse-Glimmer-30B,短短七日衝上 1,588 個讚好、24.6 萬次下載。AI 繪圖社群瞬間沸騰——因為這不是普通模型,而是 Meta 宣稱「可以直接挑戰 Midjourney 付費版」的開源作品。

今次我們實測 Muse-Glimmer-30B,用香港夜景、台灣小吃、產品設計圖三類場景,同 Midjourney V7、DALL·E 4、Stable Diffusion XL 做對比,睇吓佢係咪真係值得你放棄每月 US$30 的訂閱。

Muse-Glimmer-30B 是什麼?

先講背景。Muse-Glimmer-30B 是 Meta 基於自家 Muse 架構開發的多模態模型,參數量達 300 億。同傳統擴散模型(Diffusion Model)不同,Muse 採用 「文字到圖像的離散編碼」 技術——簡單講,佢唔係由雜訊逐步還原圖像,而係直接預測圖像的「token」,類似 GPT 生成文字的方式。

呢個技術路線有兩個明顯好處:

第一,速度快。 擴散模型要行 20 至 50 步去蕪存菁,Muse 只需 8 至 12 步就出圖。我哋用同一張 RTX 4090 實測,Muse-Glimmer 生成一張 1024×1024 圖只需 2.8 秒,Midjourney 網頁版平均要 15 秒,Stable Diffusion XL 本地跑都要 6 秒。

第二,文字理解更準。 因為佢本質上係語言模型出身,對複雜句子的理解能力遠超傳統擴散模型。實測「一個穿紅色旗袍的女生,站在香港維港夜景前,背景有霓虹燈招牌寫著『茶餐廳』,風格似王家衛電影」——Muse-Glimmer 完美還原所有元素,包括霓虹燈上的中文字。Midjourney V7 嘅中文字依然會亂碼,DALL·E 4 就將「茶餐廳」寫成「茶餐廰」。

實測對比:三大場景逐項打分

我哋用同一組 prompt,分別喺 Muse-Glimmer-30B、Midjourney V7、DALL·E 4 生成圖像,由三位設計師獨立評分(滿分 10 分)。

場景一:香港夜景寫實風

Prompt: “Aerial view of Hong Kong Victoria Harbour at night, neon lights reflecting on water, cinematic composition, hyper-realistic, 8k”

模型細節還原光影質感真實感總分
Muse-Glimmer-30B8.59.08.58.7
Midjourney V79.09.59.09.2
DALL·E 48.08.58.08.2

Midjourney 喺寫實場景依然有明顯優勢,特別係水面反射同大氣透視嘅處理。但 Muse-Glimmer 已經非常接近,如果唔係並排放一齊睇,好難分得出邊張係 Midjourney。

場景二:台灣小吃插畫風

Prompt: “Cute flat illustration of Taiwanese street food, baozi, bubble milk tea, stinky tofu, vibrant colors, sticker style, white background”

模型風格還原物件準確度色彩表現總分
Muse-Glimmer-30B9.09.59.09.2
Midjourney V78.58.08.58.3
DALL·E 49.09.09.09.0

呢個場景 Muse-Glimmer 意外地贏咗。佢對「臭豆腐」嘅理解非常準確——畫出嚟嘅係一碟切好、上面有泡菜嘅臭豆腐,而唔係 Midjourney 畫出嚟嗰舊「可疑嘅灰色方塊」。插畫風格嘅掌控亦好穩定,三張圖風格統一,冇出現 Midjourney 常見嘅「風格漂移」問題。

場景三:產品設計概念圖

Prompt: “Minimalist smart watch product design, titanium body, orange silicone band, floating UI elements, studio lighting, product photography style”

模型設計感細節精準度實用性總分
Muse-Glimmer-30B8.08.58.08.2
Midjourney V79.09.08.58.8
DALL·E 48.58.58.08.3

產品設計圖方面,Midjourney 依然係王者。Muse-Glimmer 嘅手錶錶面 UI 元素有時會出現輕微變形,例如時針分針長度不一。但作為概念發想工具,已經足夠好用。

綜合評分:Muse-Glimmer 8.7 分,Midjourney 8.8 分,DALL·E 4 8.5 分。

差距比想像中細。考慮到 Muse-Glimmer 完全免費、可以本地跑,呢個結果對 Midjourney 嚟講絕對係警號。

安裝教學:五分鐘本地跑起來

Muse-Glimmer-30B 有兩個版本:完整版(30B)量化版(GGUF)。完整版需要 24GB VRAM,量化版最低 12GB 就跑到。

硬件要求:

  • 最低:RTX 4070 / 12GB VRAM(量化版)
  • 建議:RTX 4090 / 24GB VRAM(完整版)
  • macOS:M2 Max 或以上(透過 MLX 框架)

安裝步驟(Windows / Linux):

# 1. 安裝 Python 依賴
pip install torch transformers accelerate

# 2. 下載模型(HuggingFace)
git lfs install
git clone https://huggingface.co/meta-models/Muse-Glimmer-30B

# 3. 運行推理
python generate.py --prompt "你的提示詞" --steps 10 --output output.png

Mac 用戶就用 MLX 版本:

pip install mlx mlx-lm
python -m mlx_lm.generate --model meta-models/Muse-Glimmer-30B-MLX --prompt "你的提示詞"

實際測試,MacBook M3 Max 生成一張圖大約 12 秒,速度可以接受。

免費 vs 付費:你應該點揀?

Muse-Glimmer-30B 優勢:

  • 完全免費,冇隱藏收費、冇用量上限
  • 本地運行,圖像唔會上傳到第三方伺服器,商業機密有保障
  • 文字理解強,特別係中文 prompt 嘅表現遠勝 Midjourney
  • 速度快,RTX 4090 上面 2.8 秒出圖
  • 可微調,開源模型可以按自己數據訓練

Muse-Glimmer-30B 限制:

  • 寫實人像嘅皮膚質感稍遜 Midjourney,有時會出現「塑膠感」
  • 複雜場景(多人物、多物件互動)容易出現邏輯錯誤
  • 冇內建「以圖生圖」功能,要自己寫 code 加 ControlNet
  • 30B 模型對硬件要求唔低,普通筆電跑唔郁

定價比較:

工具月費生成上限商業使用
Muse-Glimmer-30B免費無限可以
Midjourney BasicUS$10200張可以
Midjourney ProUS$60無限(慢速)可以
DALL·E 4(ChatGPT Plus)US$20有限可以
Stable Diffusion XL免費無限可以

適合邊類用戶?

強烈推薦轉會:

  • 自由工作者 / 小型工作室:每個月慳返 US$10-60,質素差距唔大
  • 需要處理敏感資料嘅設計師:本地運行確保資料唔會外洩
  • 中文內容創作者:Muse-Glimmer 對中文 prompt 嘅理解係目前開源模型最好
  • AI 開發者:開源模型可以自由改寫、微調,整合入自己嘅工作流程

建議繼續用 Midjourney:

  • 專業攝影師 / 廣告公司:需要最高質素嘅寫實圖像
  • 追求效率嘅用戶:Midjourney 嘅網頁介面、Discord 整合、參數控制仍然最成熟
  • 冇 GPU 嘅用戶:如果淨係得一部普通筆電,用 Midjourney 網頁版仲實際

延伸閱讀

總結:開源模型嘅轉捩點

Muse-Glimmer-30B 唔係完美,佢喺寫實人像、複雜場景仲有明顯進步空間。但佢證明咗一件事:開源模型已經有能力挑戰商業付費工具

三個月前,我會話「想要靚圖就俾錢 Midjourney」。今日,我會話「先試吓 Muse-Glimmer,慳返啲錢買多杯奶茶好過」。

特別係對香港台灣嘅創作者嚟講,Muse-Glimmer 對中文 prompt 嘅理解能力,係目前所有模型中最出色嘅。你唔使再為咗「茶餐廳」寫成「茶餐廰」而煩惱。

如果你有 RTX 4070 以上嘅顯示卡,強烈建議花五分鐘裝嚟試吓。反正免費,唔試白唔試。