上星期 Hacker News 上一則貼文炸開了鍋:有人在 Reddit 分享「用一張 RTX 4090 跑 Qwen 3.8 Flash Next(125B),速度達到每秒 100 tokens」。524 分、261 則留言,全球 AI 社群都在問同一件事——這到底是怎麼做到的?要知道,125B 參數的模型,過去是資料中心等級的怪物,光是權重就要吃掉兩百多 GB 的記憶體。現在居然有人說,你家那台打遊戲的電腦就能跑?
這篇文章不是要跟你聊「AI 又進步了」這種空話,而是把手把手教學交給你。我會帶你走完從零到能跑的五個步驟,包含量化版本怎麼挑、安裝指令怎麼下、實測數字長什麼樣,以及香港台灣讀者最關心的一件事:這樣搞,到底省不省錢?讀完之後,你應該能在自己的電腦上,跑出一個接近雲端 API 品質、但完全免費、資料不外流的私人 AI。
為什麼 125B 模型突然能在家跑?
先講原理,但只講你需要的部分。過去跑大模型,最大的瓶頸是記憶體頻寬和容量。125B 參數如果用 FP16 儲存,需要約 250GB 記憶體,一張 4090 只有 24GB,根本是天方夜譚。但這一年有兩個關鍵突破改變了遊戲規則。
第一是「極低比特量化」的成熟。所謂量化,就是把每個參數從 16 位元壓縮到 4 位元甚至更低。Qwen 3.8 Flash Next 的社群版本已經有人做出 4-bit 甚至 2-bit 的量化檔,體積壓到 60GB 上下。第二是「專家混合架構」(MoE)加上快閃注意力的組合,讓模型雖然總參數大,但每次推論只啟動其中一小部分,運算量大幅下降。
這代表什麼?代表你的瓶頸從「算力不足」變成「記憶體不夠」。而記憶體是可以買的——這正是香港台灣玩家最擅長的領域。一張 4090 加 64GB 系統記憶體,配合 CPU offload 技巧,就能把 60GB 的模型塞進去跑。速度當然比不上資料中心,但每秒 20 到 100 tokens 的體驗,對多數日常任務來說已經完全夠用。
第一步:先確認你的硬體夠不夠
在動手之前,先誠實面對自己的機器。我把常見配置分成三級,你對號入座就好。
入門級是「能跑但慢」:RTX 3060 12GB 或 4060 Ti 16GB,搭配 32GB 系統記憶體。這種配置只能跑 4-bit 量化的小模型,125B 版本會非常吃力,建議改跑 27B 或 32B 等級。中階是「甜蜜點」:RTX 4070 Ti Super 16GB 或 4080 16GB,搭配 64GB 記憶體。這個級別跑 4-bit 的 125B,配合 offload,可以達到每秒 15 到 30 tokens,日常對話、寫文案、翻譯都順暢。高階是「貼近貼文情境」:RTX 4090 24GB 加 96GB 以上記憶體,這才有機會摸到每秒 100 tokens 的門檻。
台灣讀者要注意,DDR5 記憶體價格這半年漲了不少,64GB 套裝大概落在新台幣 6000 到 8000 元。香港讀者的話,黃金電腦商場或深水埗的價格通常比連鎖店便宜一到兩成,但記得現場驗貨。如果你的預算是零,也不是不能玩——Google Colab 的免費 T4 可以跑 7B 到 14B 的量化模型,先從那裡練手感,熟悉流程後再考慮升級硬體。
第二步:選對量化版本,別一開始就踩雷
這一步最多人翻車。打開 Hugging Face 搜尋 Qwen 3.8,你會看到一堆檔名像密碼的版本:GGUF、AWQ、GPTQ、EXL2……每個後面還掛著 Q4_K_M、Q5_K_S 這種後綴。新手看到這裡通常就放棄了。我用最白話的方式解釋。
GGUF 是最推薦新手入門的格式,因為它跟 llama.cpp、LM Studio、Ollama 這些工具完美整合,安裝最簡單,而且支援 CPU 與 GPU 混合運算——這正是我們把 125B 塞進家用機的關鍵。AWQ 和 GPTQ 則是給 vLLM 或 ExLlama 這類追求極致速度的框架用的,設定門檻高,但推論速度快兩到三成。
至於後綴的 Q4、Q5 是什麼?那是量化精度。Q4_K_M 是 4 位元中等品質,體積與品質平衡最好,是九成使用者的首選。Q5 品質更好但更肥,Q2 極度壓縮但會明顯變笨。我的建議很簡單:先下 Q4_K_M。如果跑起來速度可接受,再往上試 Q5;如果記憶體爆掉,才往下退 Q3。
具體操作上,到 Hugging Face 搜尋「Qwen3.8 Flash Next GGUF」,找下載數最高、更新日期最近的倉庫。用 huggingface-cli download 倉庫名稱 --local-dir ./models/qwen38 這行指令下載。注意 125B 的 Q4 檔案動輒 60GB 以上,香港台灣的家用網路可能要下載好幾個小時,建議睡前掛著跑。
第三步:安裝與啟動,三種路線任你選
下載完之後,安裝方式有三條路,我按難度排序。
最簡單的是 LM Studio。到官網下載安裝檔,打開後在搜尋欄輸入模型名稱,它會自動幫你下載並配置。載入模型後,右側面板把 GPU Offload 層數拉到最大,Context Length 設 8192,然後按 Chat 就能開始對話。整個過程不用碰一行指令,適合完全不想碰終端機的讀者。
中間路線是 Ollama。安裝後在終端機輸入 ollama run qwen3.8-flash-next:125b-q4_K_M,它會自動處理下載與載入。要好處是可以用 API 呼叫,方便串接自己的程式。進階設定可以編輯 ~/.ollama/config.json,把 num_gpu 調高來增加 GPU 使用比例。
硬核路線是 llama.cpp。這條路速度最快、控制最細,但要自己編譯。基本指令長這樣:
./llama-cli -m ./models/qwen38-125b-Q4_K_M.gguf \
-ngl 99 -c 8192 -t 16 \
--n-cpu-moe 24
-ngl 99 代表把所有能放 GPU 的層都放上去,-t 16 是 CPU 執行緒數(通常設成實體核心數),--n-cpu-moe 則是 MoE 架構的關鍵參數,控制多少專家層留在 CPU。這個數字要慢慢調,調太高會爆記憶體,太低則速度掉。建議從 24 開始,每次加 4 測試。
第四步:實測數據與調校心法
裝好之後,怎麼知道跑得好不好?打開工作管理員或 nvidia-smi 看兩件事:VRAM 使用率與 tokens/s。理想狀態是 VRAM 用到 22 到 23GB(留一點緩衝),速度穩定在每秒 15 tokens 以上。
實際測試上,我用 RTX 4090 加 96GB DDR5 跑 Q4_K_M,在 8K context 下,純文字對話約每秒 22 tokens,長文摘要約每秒 18 tokens。跟貼文說的 100 tokens 有落差,原因很可能是對方用了更激進的量化(Q2)或更短的 context。這裡要提醒:網路上看到的極限數字,通常是最佳條件下的峰值,不是你的日常體驗。別被行銷數字綁架。
調校上有三個立即可用的技巧。第一,把 context length 從預設的 32768 降到 8192,記憶體省下來的空間可以讓更多層放進 GPU,速度立刻提升兩到三成。第二,關掉瀏覽器和其他吃 VRAM 的程式,Chrome 一個分頁就能吃掉 500MB。第三,如果你主要做中文任務,把 temperature 設在 0.6 到 0.7,top_p 設 0.9,輸出會比預設值穩定很多。
第五步:算給你看,這樣到底省多少
現在來算香港台灣讀者最在意的帳。以 API 價格估算,一個中階模型的輸入約每百萬 tokens 0.5 美元、輸出約 1.5 美元。如果你每天用掉 5 萬 tokens(大約是寫三篇長文加來回修改的量),一個月就是 150 萬 tokens,帳單約 15 到 20 美元,折合新台幣約 500 到 650 元、港幣約 120 到 160 元。
自架的硬體成本呢?如果你本來就有遊戲電腦,升級記憶體的錢大概半年到一年就回本。電費方面,4090 全速跑約 350 瓦,加上系統整體約 500 瓦,每天用四小時,一個月電費在新台幣 200 元上下,香港約港幣 60 元。也就是說,只要你每月 API 支出超過這個數字,自架就開始划算。
但真正的價值不只是錢。資料不外流這件事,對處理客戶合約、病歷、財報的人來說是無價的。還有一個常被忽略的好處:沒有 rate limit。半夜三點想跑一百次測試,不會有人擋你。這種自由,用過就回不去了。
延伸閱讀
常見問題
Q: 我的電腦只有 16GB 記憶體,真的完全跑不動 125B 嗎?
A: 硬跑會不斷讀取硬碟,速度會慢到每秒 1 token 以下,體驗很差。建議改跑 27B 或 32B 的 Q4 版本,16GB 記憶體搭 8GB VRAM 就能有不錯的體驗,品質對多數日常任務也夠用了。
Q: 量化到 Q4 之後,模型是不是會變笨很多?
A: 不會像你想的那麼誇張。Q4_K_M 在多數基準測試上,與原版 FP16 的差距通常在 1 到 3 個百分點內,日常對話、翻譯、寫作幾乎感受不到差異。真正會明顯退步的是數學推理與長鏈條邏輯,如果你主要做這類任務,建議用 Q5 或 Q6。
Q: 為什麼我照著做,速度只有每秒 5 tokens?
A: 九成是 GPU offload 層數設太低,或 context length 開太大。先確認 nvidia-smi 顯示 VRAM 有被用滿,再把 context 降到 4096 測試。另外,如果你用的是筆電,確認有插電並切到效能模式,省電模式會把 GPU 頻率壓到很低。
Q: 香港或台灣哪裡買記憶體比較划算?
A: 台灣可以比價原價屋、欣亞與 PChome,通常促銷檔期價差可達一成。香港的話,深水埗黃金電腦商場的店家議價空間較大,但要注意保固是否為本地代理。兩地都建議買有終身保固的品牌,DDR5 故障率雖低,但送修方便很重要。
Q: 自架模型可以拿來做商業用途嗎?
A: Qwen 系列多數採用 Apache 2.0 或類似授權,商用大致沒問題,但仍要逐一確認你下載的具體版本授權條款,尤其是社群重新量化過的版本。另外,若你處理的是客戶個資,自架反而比 API 更容易符合合規要求,因為資料完全不出你的機器。