DeepSeek V4 Flash 上週發布後,社群討論度爆表——但很多人實際下載後才發現,原始模型要佔用超過 40GB 的顯示卡記憶體,一般消費級顯示卡根本跑不動。今天要介紹的 Unsloth 團隊推出的 DeepSeek-V4-Flash-0731-GGUF 量化版本,直接把記憶體需求砍到 8GB 以下,連 MacBook 都能順跑。這篇文章會帶你完整實測,從安裝步驟到實際效能,一次講清楚。

為什麼大家都在用 Unsloth?

Unsloth 這個名字在開源 AI 社群已經不是新聞。他們專注做一件事:把大型語言模型「瘦身」,讓普通人也能在自己電腦上跑。過去一年,Unsloth 推出的量化工具已經被下載超過數百萬次,是 HuggingFace 上最受歡迎的優化工具之一。

這次 DeepSeek V4 Flash 發布後不到 24 小時,Unsloth 就火速推出對應的 GGUF 量化版本,目前在 HuggingFace 上已經累積超過 69,000 次下載,熱度持續攀升。GGUF 是 llama.cpp 生態系的標準格式,好處是可以在各種裝置上執行,從 Windows PC、Mac、Linux 到樹莓派都能用。

Unsloth 的量化技術特別之處在於,他們不只是單純把模型壓縮,而是透過動態量化演算法,在保持模型精度的同時,大幅降低記憶體需求。根據官方數據,他們的 4-bit 量化版本可以保留原始模型約 97% 的效能,但記憶體需求減少將近 80%。

安裝步驟:五分鐘搞定

我實際在自己的 MacBook Pro(M1 Pro 16GB)和 Windows PC(RTX 3060 12GB)上測試,安裝過程非常簡單,完全不需要寫任何程式碼。以下是完整步驟:

第一步:安裝 Ollama(Mac 和 Windows 都適用)

前往 Ollama 官網下載對應系統的安裝檔。Mac 用戶直接下載 .dmg 檔,Windows 用戶下載 .exe 檔。安裝過程就是下一步下一步,完全沒有難度。

第二步:下載 DeepSeek V4 Flash 量化版

打開終端機(Mac)或命令提示字元(Windows),輸入以下指令:

ollama pull unsloth/deepseek-v4-flash-0731-gguf:q4_k_m

這個指令會自動下載 4-bit 量化版本,檔案大小約 7.8GB。如果你的電腦記憶體比較小,可以改下載 q3_k_m 版本(約 5.9GB),犧牲一點點精度換取更低的記憶體需求。

第三步:開始使用

下載完成後,輸入:

ollama run unsloth/deepseek-v4-flash-0731-gguf:q4_k_m

就會進入互動式對話介面。你也可以透過 Ollama 的 API 串接其他應用程式,例如 Open WebUI 或 Continue 等工具。

整個過程真的不需要寫任何程式碼,Mac 用戶從零開始大概五分鐘就能完成,Windows 用戶因為要安裝驅動程式,可能需要十分鐘左右。

實測數據:MacBook 也能跑?

我在兩台裝置上的實測結果如下:

MacBook Pro M1 Pro 16GB:

  • 模型載入時間:約 12 秒
  • 每秒生成速度:18-22 tokens
  • 記憶體使用量:峰值約 9.2GB
  • 系統順暢度:整體流暢,風扇微轉

Windows PC RTX 3060 12GB:

  • 模型載入時間:約 8 秒
  • 每秒生成速度:35-40 tokens
  • 記憶體使用量:峰值約 8.5GB
  • 系統順暢度:非常流暢,GPU 使用率約 70%

以 MacBook 來說,每秒 20 tokens 左右的速度,閱讀長篇文章或進行一般問答綽綽有餘。如果你只是要處理簡單的程式碼片段或文件摘要,這個速度完全夠用。

RTX 3060 的表現更亮眼,速度幾乎是 MacBook 的兩倍。不過要注意的是,如果你的顯示卡記憶體低於 8GB(例如 RTX 3050 或 GTX 1660),建議選擇 q3_k_m 版本,否則可能會遇到記憶體不足的問題。

實際使用體驗:程式碼能力驚人

除了跑分數據,我更關心實際使用體驗。我測試了幾個常見場景:

程式碼生成: 請它寫一個 Python 爬蟲抓取香港天文台的天氣資料,它產出的程式碼結構清晰、註解完整,而且可以直接執行。這部分表現出乎意料地好,甚至比一些付費 API 服務還要精準。

中文理解: 用繁體中文問它關於台灣半導體產業的問題,回答內容有條理,用詞也相當自然。雖然偶爾會出現簡體中文的用語,但整體來說繁體中文的理解能力在水準之上。

長文件處理: 給它一份 5000 字的中文新聞稿,請它總結重點。它能夠準確抓出關鍵資訊,但上下文長度有限,超過 8000 tokens 就會開始遺漏細節。如果你需要處理超長文件,建議分段輸入。

不過也有一些限制需要注意。首先,它沒有聯網功能,無法查詢最新資訊。其次,它的知識截止日期是 2026 年 6 月,之後發生的事情它都不知道。最後,它不支援圖片輸入,只能處理純文字。

價格與效能:免費 vs 付費

這款量化模型完全免費,沒有隱藏費用或使用限制。相比之下,如果你使用 DeepSeek 官方 API,每百萬 tokens 輸入收費約 0.14 美元,輸出約 0.28 美元。以一個月產生 100 萬 tokens 的使用量來算,API 費用約 20 美元左右。

如果你的使用量不大,用 API 反而更划算,因為不需要自己準備硬體。但如果你每天都要大量使用,或者注重資料隱私不想把資料送到雲端,本地跑量化模型就是更明智的選擇。

硬體成本方面,如果你已經有一台 16GB 記憶體的 MacBook 或 8GB 以上的顯示卡,就不用額外花錢。但如果需要添購設備,一台二手 RTX 3060 約 4000 港幣,16GB RAM 的 MacBook Air 約 8000 港幣,長期來看還是比每個月付 API 費用划算。

延伸閱讀

適合誰用?

總結來說,Unsloth 的 DeepSeek V4 Flash 量化版最適合以下幾類人:

程式設計師: 需要一個免費、離線、可自訂的 AI 助手來協助寫程式、Debug、產生註解。量化版的程式碼能力足以應付日常工作。

注重隱私的使用者: 不想把公司機密或個人資料送到雲端處理,本地部署是最安全的選擇。所有資料都留在自己的電腦上。

學生與研究者: 需要大量測試不同模型,但預算有限。免費的量化版本讓你可以盡情實驗,不用擔心 API 費用爆表。

不適合的人: 如果你需要處理超長文件(超過 8000 tokens)、需要圖片辨識功能,或者追求最快的回應速度,建議還是使用雲端 API 服務。

整體來說,Unsloth 這次的 DeepSeek V4 Flash 量化版本做得相當出色。安裝簡單、效能優異、完全免費,而且支援 Mac 和 Windows 兩大平台。如果你一直想試試本地跑 AI 模型但覺得門檻太高,現在就是最好的時機。五分鐘安裝,立刻就能體驗完全離線、不用付費的 AI 助手,這種自由度是雲端服務無法比擬的。