你有沒有過這種經驗?打開 ChatGPT 想問個問題,結果網路卡住,等了老半天只看到轉圈圈。或者,你擔心自己的私人資料被拿去訓練 AI,心裡總覺得毛毛的。
別擔心,今天我要教你一個超實用的技巧:在你的電腦上離線執行 Google 最新的 Gemma 4 開源模型。沒錯,就是那個剛在 HuggingFace 上爆紅、一週內被下載超過 67 萬次的模型。
這篇文章會從零開始,一步步帶你安裝、設定,甚至教你怎麼用它來寫作、翻譯和整理資料。你不需要是程式高手,只要會開終端機就行。
為什麼你該試試離線 AI?
你可能會問:「我用 ChatGPT 用得好好的,為什麼要這麼麻煩?」
好問題。離線 AI 有三個你無法忽視的優勢。
第一是 隱私。當你把敏感文件餵給雲端 AI,那些資料就等於送出去了。但如果你在自己的電腦上跑模型,所有資料都留在你的硬碟裡,誰也看不到。特別是香港的朋友,最近不少企業開始規定員工不能用公共 AI 處理客戶資料,離線方案成了唯一選擇。
第二是 速度。離線執行沒有網路延遲。我測試過,在 M2 MacBook Air 上,Gemma 4 12B 模型回應一句話只要 3-5 秒,比連上 ChatGPT 還要快。
第三是 省錢。不用每個月付 20 美元給 ChatGPT Plus。電力成本?跑一個小時大概花你 0.5 港幣的電費。
聽起來不錯吧?那我們就開始動手。
第一步:你的電腦跑得動嗎?
在開始之前,我們先確認你的電腦夠不夠力。
Gemma 4 有幾個版本。我們推薦用 12B 參數的版本,因為它在效能和硬體需求之間取得很好的平衡。你不需要頂級的顯示卡。
具體需求如下:
- Mac 用戶:M1 晶片以上,8GB RAM 以上。M2 或 M3 會更順暢。
- Windows/Linux 用戶:8GB RAM 以上。如果你有 NVIDIA 顯示卡(6GB VRAM 以上),速度會更快。
- 硬碟空間:至少 10GB 可用空間,因為模型檔案大約 7GB。
如果你不確定自己的電腦規格,沒關係。Mac 用戶點左上角蘋果圖示 >「關於這台 Mac」。Windows 用戶按 Win + I 打開設定,點「系統」>「關於」。
確認規格後,我們進入下一步。
第二步:安裝 Ollama,一鍵搞定
最簡單的離線 AI 執行工具是 Ollama。它就像 AI 界的「一鍵安裝包」,幫你把複雜的設定全部搞定。
先到 ollama.com 下載安裝檔。選擇你的作業系統(Mac、Windows 或 Linux),下載後直接安裝。Mac 用戶只要把 Ollama 圖示拖進應用程式資料夾就行。
安裝完成後,打開終端機(Mac 用戶按 Cmd + 空白鍵,搜尋「終端機」;Windows 用戶按 Win + R,輸入 cmd)。
輸入以下指令:
ollama pull gemma4:12b
這條指令會下載 Gemma 4 12B 模型。根據你的網路速度,大概需要 5 到 20 分鐘。下載完成後,你會看到類似這樣的訊息:
pulling manifest
pulling 7.2 GB ████████████████████████████████████████████████████████████████████████████████████ 100%
success
恭喜!你已經成功把 Gemma 4 裝進你的電腦了。
第三步:開始跟 AI 對話
下載完成後,要啟動模型非常簡單。在終端機輸入:
ollama run gemma4:12b
你會看到一個提示符號 >>>,這代表 AI 已經準備好回答你的問題了。
試著輸入:
請用繁體中文自我介紹,並說明你可以幫我做什麼。
Gemma 4 會用中文回應你。如果你發現它回英文,可以加上「請用繁體中文回答」的指令。
小技巧:離線 AI 的好處是你可以隨時中斷對話。按 Ctrl + D 或輸入 /bye 就能退出。下次要繼續對話,只要再輸入 ollama run gemma4:12b 就行。
第四步:實戰應用 — 讓 AI 幫你工作
光會對話還不夠,我們來看看 Gemma 4 能幫你解決什麼實際問題。
情境一:寫一封專業的商業郵件
假設你要寫一封給客戶的道歉信,因為專案延遲了。你可以這樣問:
請幫我寫一封商業郵件,主題是「專案延遲通知」。對象是香港客戶,語氣要專業且誠懇。內容包括:1. 說明延遲原因(技術問題)2. 新的預計完成日期(下週五)3. 提供折價補償(10%折扣)。請用繁體中文。
Gemma 4 會生成一封完整的郵件草稿。你可以直接複製貼上,稍作修改就能用。
情境二:翻譯文件
如果你有一份英文合約需要翻譯,不用再花錢找翻譯社。把合約文字貼進去,然後說:
請將以下英文合約翻譯成繁體中文,保留專業用語,並確保法律條文準確:
[貼上你的合約文字]
情境三:整理會議記錄
開完會後,把錄音轉成文字(可以用免費的語音轉文字工具),然後貼給 Gemma 4:
請幫我整理以下會議記錄,提取三個重點、兩個行動項目,以及下次會議時間。用條列式呈現:
[貼上會議文字]
不到 10 秒,你就有一份乾淨的會議摘要。
第五步:進階技巧 — 自訂 AI 角色
Ollama 還有一個殺手級功能:Modelfile。你可以自訂 AI 的個性和行為。
舉例來說,如果你想要一個「香港風格的 AI 助手」,可以建立一個檔案叫做 Modelfile,內容如下:
FROM gemma4:12b
SYSTEM """你是一個友善的香港 AI 助手。你習慣使用廣東話和繁體中文混合回答。你的語氣親切,像一個經驗豐富的朋友。當你不知道答案時,會誠實地說「我唔清楚」。"""
然後在終端機執行:
ollama create my-hk-helper -f ./Modelfile
這樣你就創造了一個專屬的 AI 模型。以後只要輸入 ollama run my-hk-helper,它就會用廣東話跟你聊天。
延伸閱讀
常見問題
Q: 我的電腦只有 8GB RAM,跑得動嗎?
A: 可以。Gemma 4 12B 在 8GB RAM 的 M1 Mac 上可以順暢執行,只是回應速度會稍微慢一點(約 5-8 秒)。如果你覺得太慢,可以試試更小的版本,如 gemma4:7b。
Q: 離線 AI 會不會比較笨? A: 不會。Gemma 4 12B 的效能接近 GPT-3.5,在中文理解和生成上表現相當不錯。當然,它沒有即時網路搜尋功能,所以不能問它「今天天氣如何」或「最新新聞」。
Q: 我可以同時跑多個模型嗎?
A: 可以,但會消耗更多記憶體。不建議在 8GB RAM 的電腦上同時跑兩個 12B 模型。你可以用 ollama ps 查看目前正在執行的模型,用 ollama stop gemma4:12b 停止某個模型。
Q: 如何更新到最新版本的 Gemma 4?
A: 只要重新執行 ollama pull gemma4:12b,Ollama 會自動下載最新版本。
Q: 這個方法安全嗎?會不會有後門? A: Gemma 4 是 Google 官方開源的模型,Ollama 也是開源工具,程式碼公開可審查。而且所有運算都在你的電腦上執行,不會有資料外洩的風險。