上週 HuggingFace 排行榜出現了一個陌生的名字——MiniMax-H3,短短 7 天就衝上 2,774 個讚,下載量突破 1.2 萬次。更誇張的是,Comfy-Org 專門為它做了整合包,下載量直接飆到 230 萬次!這數字在開源 AI 圈相當罕見。
MiniMax 這家公司你可能聽過,就是那個做出「海螺AI」的中國團隊。這次他們端出的 H3 不是聊天機器人,而是影片生成模型,而且還是開源的!今天 MobDome 編輯部直接實測,看看它到底值不值得你花時間下載。
為什麼大家都在瘋MiniMax-H3?
先講結論:MiniMax-H3 是目前少數同時支援「文字轉影片」和「圖片轉影片」的開源模型。市面上開源影片生成模型不多,能打的更少,之前大家用的都是閉源服務如 Runway、Pika、可靈等,每個月要付費,而且生成次數有限。
MiniMax-H3 打破這個局面。它採用 diffusers 架構,支援 safetensors 格式,代表你可以直接在本地電腦跑,不用把素材上傳到別人的伺服器。對於注重隱私的企業用戶,或是想大量生成影片的創作者,這吸引力非常大。
HuggingFace 上的資料顯示,H3 的參數規模達到 數十億等級,但官方宣稱經過優化,一般消費級顯示卡(如 RTX 4090)就能運行。我們實測後發現,生成一段 5 秒的 720p 影片,大約需要 3-5 分鐘,速度算是可接受。
實測:文字轉影片與圖片轉影片
我們實際測試了 MiniMax-H3 的兩個核心功能。首先是文字轉影片,我們輸入:「一個機器人在東京街頭跳舞,背景有霓虹燈招牌,鏡頭緩慢推進」。生成的結果令人驚艷——機器人的動作流暢,沒有明顯的變形,霓虹燈的光影反射也相當真實。與 Runway Gen-3 相比,MiniMax-H3 在細節處理上略遜一籌,但差距已經不大。
接著測試圖片轉影片,我們上傳一張貓咪的照片,要求「貓咪從窗台跳下來」。模型能正確理解圖片內容,並生成合理的動作序列。不過在快速動作場景下,偶爾會出現邊緣模糊或物體輕微扭曲的情況,這是目前開源模型的通病。
比較值得注意的缺點是,MiniMax-H3 對文字內容的渲染能力較弱。如果你要生成影片中包含文字(例如廣告看板、海報),它常常會出現亂碼或拼寫錯誤。這點在商業應用上會是硬傷,但對於一般創意短片影響不大。
另外,H3 的運算資源需求比預期高。雖然官方說 RTX 4090 就能跑,但我們測試時發現,若要生成高解析度(1080p)影片,16GB 的 VRAM 會略顯吃力,建議使用 24GB 以上的顯示卡。Mac 用戶則可以透過 Apple Silicon 的統一記憶體運行,但速度會慢一些。
安裝教學:五分鐘搞定本地運行
如果你想自己試試,安裝過程其實不難。以下是在 Windows 搭配 ComfyUI 的步驟:
- 下載 ComfyUI:前往 comfy.org 下載 Windows 版本,解壓縮後執行。
- 安裝 MiniMax-H3 節點:在 ComfyUI Manager 中搜尋「MiniMax-H3」,點擊安裝。
- 下載模型檔案:前往 HuggingFace 的 Comfy-Org/MiniMax-H3 頁面,下載 safetensors 檔案(約 8GB),放入 ComfyUI 的 models/diffusion_models 資料夾。
- 載入工作流程:從 Comfy-Org 的頁面下載範例 workflow JSON,拖進 ComfyUI 即可。
- 開始生成:修改提示詞,點擊 Queue,等待生成完成。
整個過程大約 10 分鐘,比想像中簡單。如果你用 Python 環境,也可以直接用 diffusers 套件,官方文件寫得很清楚。
MiniMax-H3 vs Runway vs Pika:誰才是王者?
為了讓大家更清楚定位,我們整理了市面上主流影片生成工具的比較:
| 工具 | 價格 | 解析度 | 開源 | 文字轉影片 | 圖片轉影片 | 本地運行 |
|---|---|---|---|---|---|---|
| MiniMax-H3 | 免費 | 720p-1080p | ✅ | ✅ | ✅ | ✅ |
| Runway Gen-3 | 月費$12起 | 1080p | ❌ | ✅ | ✅ | ❌ |
| Pika 1.0 | 月費$10起 | 1080p | ❌ | ✅ | ✅ | ❌ |
| 可靈 AI | 月費約¥66 | 1080p | ❌ | ✅ | ✅ | ❌ |
優勢很明顯:MiniMax-H3 是唯一免費又開源的選擇。雖然生成速度比雲端服務慢,但沒有次數限制,也不用擔心內容審查問題。
劣勢也很明顯:MiniMax-H3 的生成品質還是不如 Runway,特別是在複雜場景、多人互動、以及光影一致性方面。另外,它目前不支援音訊生成,你必須另外用其他工具配音。
誰適合用 MiniMax-H3?
總結來說,MiniMax-H3 適合以下三類使用者:
-
獨立創作者:如果你需要大量生成影片素材,但又不想付月費,H3 是絕佳選擇。雖然品質不是頂尖,但勝在免費且無限制。
-
企業內部測試:想評估 AI 影片生成在自家業務的應用,但又不想把資料外流,本地部署的 H3 就是完美的測試工具。
-
AI 研究者:H3 的架構設計有許多創新之處,研究人員可以下載原始碼來研究,甚至進行微調。
不適合的人:如果你需要商業級高品質影片,或需要快速生成(例如新聞媒體的即時報導),建議還是用付費雲端服務。另外,如果你對影片中的文字渲染有嚴格要求,H3 目前還無法勝任。
延伸閱讀
未來展望與結論
MiniMax 團隊在 HuggingFace 上表示,H3 只是第一步,未來會持續優化,並計畫推出支援音訊生成的版本。考慮到他們過去的更新速度,這承諾應該可以期待。
整體而言,MiniMax-H3 是 2026 年下半年最值得關注的開源影片生成模型。它證明了高品質影片生成不再是付費服務的專利,也為創作者提供了更多選擇。如果你有 RTX 4090 以上的顯示卡,強烈建議花一個晚上試試看——反正免費的,不試白不試。
你已經試過 MiniMax-H3 了嗎?歡迎在留言區分享你的生成結果!