上週 HuggingFace 上出現一個很誇張的數字:Qwen3.8-27B 一週內衝破 16700 個讚、下載量逼近 700 萬次。對一個 27B 參數的開源模型來說,這幾乎是「現象級」的熱度。但多數香港、台灣讀者看到新聞的反應都是同一句:「所以我要怎麼用?」
這篇就是要解決這件事。我會帶你從零開始,把 Qwen3.8-27B 裝進你自己的電腦,不用付月費、不用把公司資料上傳到別人的伺服器。整篇教學大約 15 分鐘可以跟著做完,如果你只想先試水溫,我也會告訴你哪個方法最快。
為什麼大家突然都在講 Qwen3.8-27B?
先講結論:它不是「又一個開源模型」,而是第一個在 27B 這個尺寸上,把「對話品質」和「本機可跑」這兩件事同時做到位的模型。
過去你要嘛用小模型(7B、8B),跑得快但常常答非所問;要嘛用雲端大模型,聰明但要付錢、要連網、資料還得出門。Qwen3.8-27B 的定位剛好卡在中間:它夠聰明,可以處理寫文案、整理會議紀錄、翻譯中英日文、寫簡單程式;同時它的體積又壓在一般電競筆電或中階桌機可以負擔的範圍。
對香港和台灣的上班族來說,這件事的實際意義是:你可以把客戶合約、內部財報、病歷這種「絕對不能上傳」的東西,丟給一個跑在自己電腦裡的 AI 處理。這在金融、法律、醫療、會計這幾個行業,價值非常高。
我的電腦跑得動嗎?先看硬體門檻
這是最多人卡關的地方,所以我們先講清楚。
記憶體(RAM)或顯示卡記憶體(VRAM)是關鍵,不是 CPU 多快。27B 模型如果用 4-bit 量化(最常見的 Q4 版本),檔案大約 16GB 左右。實務上的建議門檻是:
如果你用的是 Apple Silicon 的 Mac(M1 Pro 以上、記憶體 16GB 起),可以直接跑 Q4 版本,速度大概每秒 8 到 15 個字,閱讀上完全夠用。記憶體 32GB 的 Mac 更舒服,可以開到 Q5 或 Q6 量化,答案品質明顯更好。
如果你用的是 Windows 桌機,有 RTX 3060 12GB 以上的顯示卡,可以把大部分運算丟給 GPU,速度會快很多。只有 8GB VRAM 的顯卡也不是不能跑,但要靠系統記憶體補位,速度會掉到每秒 3 到 5 個字,適合「不急、但要離線」的場景。
純 CPU、沒有獨顯的筆電,老實說不建議跑 27B。這種情況我後面會給你替代方案。
方法一:Ollama 三步驟,最快裝好
對大多數人來說,Ollama 是最省事的選擇。它把下載、量化、執行全部包成一行指令。
第一步,到 ollama.com 下載對應你系統的安裝檔(macOS、Windows、Linux 都有),裝好之後打開終端機或命令提示字元。
第二步,輸入這行指令:
ollama run qwen3.8:27b
第一次執行時它會自動下載模型檔,大約 16GB,視網速可能要等 10 到 40 分鐘。下載完就會直接進入對話介面,你可以馬上開始打字測試。
第三步,如果你想要圖形介面而不是黑底白字,可以額外安裝 Open WebUI 或直接用 Ollama 官方的桌面 App。裝好之後,左側會列出你本機所有的模型,點一下就能切換,用起來就跟 ChatGPT 的網頁版幾乎一樣。
小提醒:如果你的電腦記憶體剛好卡在 16GB,建議改用 qwen3.8:27b-q4_K_M 這個標籤,它是專門為低記憶體優化的量化版本,穩定度會好很多。
方法二:LM Studio,給不想碰指令的人
如果你看到終端機就頭痛,LM Studio 是更友善的選擇。它是一個完整的圖形化應用,Windows 和 macOS 都能裝。
安裝後打開,左側有一個搜尋欄,直接輸入「Qwen3.8 27B」。清單會列出各種量化版本,旁邊會標示檔案大小和建議的記憶體需求。選一個符合你硬體的版本,按右邊的下載按鈕。
下載完成後,切到上方的聊天分頁,在模型下拉選單選中它,就可以開始對話。LM Studio 還會即時顯示每秒生成速度和記憶體佔用,對想調校效能的人來說很方便。
它有一個很實用的功能叫「系統提示預設」:你可以把常用的角色設定(例如「你是繁體中文財經助理,回答要精簡」)存起來,每次開新對話自動套用,省下重複打字的時間。
裝好之後,怎麼問才問得出好答案?
模型裝好只是第一步,真正的差別在「你怎麼問」。Qwen3.8 對繁體中文的支援相當好,但它仍然需要清楚的指令。
第一個技巧是給它角色和格式。不要只說「幫我寫一封信」,改成「你是香港中小企的行政主管,幫我寫一封給供應商的催貨郵件,語氣禮貌但明確,200 字內,用繁體中文」。加上角色、對象、語氣、長度這四個元素,產出品質會直接跳一個檔次。
第二個技巧是把長文件分段餵。27B 模型的上下文視窗雖然不小,但一次塞幾萬字,它會開始抓不到重點。實務做法是先把財報或合約切成章節,一次處理一段,最後再叫它整合摘要。
第三個技巧是要求它先列架構再寫內容。你可以說「先給我三個大綱選項,我選一個之後你再展開」。這樣你可以先確認方向對不對,避免它洋洋灑灑寫了 800 字結果完全離題,浪費你的時間。
跑不動怎麼辦?三個替代路線
如果你的電腦真的撐不住 27B,別硬撐,有三條路可以走。
第一,改用同系列的較小版本。Qwen 家族有 8B、14B 等尺寸,14B 的 Q4 版本只要 9GB 左右,多數 16GB 記憶體筆電都能跑,中文表現也還算堪用。
第二,用量化更兇的版本。Q3 或 Q2 量化可以把檔案壓到 11GB 甚至 8GB 以下,代價是答案會變得比較「跳」,適合拿來做摘要,不適合寫正式文件。
第三,如果只是偶爾用,就別本機跑了。把需要保密的任務留給本機小模型,一般性的寫作、翻譯、腦力激盪,直接用雲端服務反而更省事。混合使用才是最務實的策略。
重點回顧
Qwen3.8-27B 之所以值得學,是因為它讓「在自己電腦跑一個夠聰明的 AI」從發燒友的玩具,變成一般上班族做得到的事。硬體門檻大約是 16GB 記憶體起跳,Mac 用 Ollama 最快,Windows 用戶可以選 LM Studio 的圖形介面。裝好之後,真正的功力在提問方式:給角色、給格式、分段餵、先要架構。
最重要的是心態:不要期待它一次就完美。把它當成一個剛到職、很聰明但還不熟你業務的助理,你需要花幾次對話把它調教到位。一旦調好,它會變成你每天都會打開的工具。
延伸閱讀
常見問題
Q: 我的 Mac 只有 8GB 記憶體,真的完全跑不動 27B 嗎?
A: 幾乎跑不動。8GB 記憶體連載入 Q4 量化版本都不夠,系統會大量使用硬碟置換,速度會慢到每秒不到 1 個字,實用性趨近於零。建議改用 8B 或 14B 的較小模型,體驗會好非常多。
Q: 用 Ollama 下載的模型檔案存在哪裡?會佔很多空間嗎?
A: macOS 和 Linux 預設存在 ~/.ollama/models,Windows 則在使用者資料夾下的 .ollama 目錄。一個 27B 的 Q4 模型大約佔 16GB,如果你同時下載多個版本,很容易吃掉 50GB 以上,建議定期用 ollama list 檢查並刪掉不用的模型。
Q: 本機跑的 Qwen3.8 跟雲端的 GPT、Claude 比,差距有多大?
A: 在繁體中文寫作、翻譯、摘要這類任務上,27B 的 Q4 版本大約有雲端旗艦模型七到八成的表現,日常使用很夠。但在複雜推理、長篇程式除錯、需要最新資訊的問題上,差距還是明顯。建議把本機模型定位在「隱私優先的日常助理」,而不是要它取代雲端服務。
Q: 為什麼我跑出來的答案有時候會簡體中文夾雜繁體?
A: 這是訓練資料比例造成的。解法是在系統提示明確寫「一律使用繁體中文回答,不要出現簡體字」,通常就能大幅改善。如果還是偶爾出錯,可以在提問最後再加一句「請用台灣/香港用語的繁體中文重寫一次」。
Q: 公司電腦有資安限制,可以安裝 Ollama 嗎?
A: 這要看公司的資安政策。Ollama 本身是離線執行的,模型下載完之後不需要連網,資料不會外傳,這對資安其實是加分。但安裝軟體本身可能違反公司規定,建議先詢問 IT 部門。有些企業其實樂見員工用離線模型處理敏感資料,反而比偷偷用雲端服務安全。