「我想試試最新的開源AI模型,但……是不是要很強的電腦?是不是要寫一堆程式碼?」

這是 MobDome 編輯部最常收到的讀者提問。很多人看到 Hugging Face 上那些幾千、幾萬讚的模型,第一個反應就是「哇,好厲害,但好像離我很遠。」尤其是看到「GGUF」、「safetensors」、「量化」這些名詞,腦袋就開始打結。

但其實,2026 年的今天,在家裡跑 AI 模型已經變得超乎你想像的簡單。你不需要一台幾十萬的伺服器,也不需要會寫 Python。只要你的電腦不是太古老(有 8GB RAM 以上),你就能在五分鐘內,讓一個強大的開源模型在你的電腦上跑起來。

這篇教學,就是要帶你跨過那道「看起來很難」的門檻。我們會用最直白的方式,告訴你為什麼現在是玩本地模型最好的時機,然後手把手教你用兩個免費工具,直接在你的電腦上跟 AI 對話。準備好了嗎?我們開始吧!

為什麼現在是「入坑」最佳時機?

你可能會想:「我用 ChatGPT 或 Claude 就好了,為什麼要自己在家裡跑模型?」這確實是個好問題。答案有三個:

第一,隱私。當你把資料傳到雲端,就等於把資料交給別人。如果你處理的是公司機密、個人日記,或是任何你不想讓第三方看到的內容,本地模型就是你的最佳選擇。所有運算都在你的電腦上完成,資料完全不會離開你的硬碟。

第二,免費且無限。雲端服務再好,都有用量限制或收費機制。本地模型一旦下載好,你要問多少問題就問多少,完全不用擔心額度用完或要付費。

第三,最新、最強。就像我們在 Hugging Face 上看到的,像是 yuxinlu1/gemma-4-12B-coder-fable5-composer2.5-v1-GGUFnvidia/LocateAnything-3B 這些模型,一推出就獲得數千讚、數萬下載。雲端服務的模型更新通常有 lag,但開源社群的最新成果,你永遠可以第一時間在自己的電腦上體驗。

你可能會擔心:「我的電腦跑得動嗎?」放心,現在很多模型都經過「量化」(Quantization),也就是把模型檔案壓縮,讓它能在一般消費級電腦上運行。你不需要頂級的 RTX 4090,一台配備 16GB RAM 的 MacBook Air 或 Windows 筆電,就已經足夠入門。

五分鐘搞定!你的第一個本地 AI

好,我們不廢話,直接進入實作。我們要用的工具是 Ollama,它是目前最簡單、最受歡迎的本地 AI 運行工具。你只需要做三件事:下載、安裝、拉取模型。

第一步:下載並安裝 Ollama

打開你的瀏覽器,前往 Ollama 官網。你會看到一個大大的下載按鈕。Ollama 支援 macOS、Windows 和 Linux。點擊下載符合你作業系統的版本。

安裝過程就像安裝一般軟體一樣直覺。在 macOS 上,你會得到一個 .dmg 檔,打開後把 Ollama 拖到應用程式資料夾就行了。在 Windows 上,就是一個標準的安裝精靈,一直按「下一步」就好。

安裝完成後,你會在工作列或選單列看到一個可愛的羊駝圖示(Ollama 的吉祥物),這代表它已經在背景運行了。

第二步:打開終端機,下指令

接下來,我們要用到「終端機」(Terminal)或「命令提示字元」(CMD)。聽起來很可怕?別擔心,你只需要打一句話。

  • macOS 用戶:打開「啟動台」> 搜尋「終端機」並打開。
  • Windows 用戶:按下 Windows 鍵 + R,輸入 cmd,然後按 Enter。

打開後,你會看到一個黑底白字的視窗。在這裡,輸入以下指令:

ollama run gemma3:1b

按下 Enter。這句指令的意思是:「Ollama,請下載並運行 Gemma 3 模型,我要 1B 參數的版本。」

等等,什麼是 1B? 這代表模型的參數量,大約是 10 億。參數越多,模型通常越聰明,但也需要更多記憶體。1B 版本非常輕量,任何電腦都能跑,非常適合用來測試。

你會看到 Ollama 開始下載模型檔案。進度條會顯示下載速度,這取決於你的網路。通常幾分鐘內就會完成。

第三步:開始聊天!

下載完成後,你的終端機畫面會變成一個對話介面。你可以直接打字問它問題,就像跟 ChatGPT 聊天一樣。

試試看輸入:「你好!請用繁體中文自我介紹。」

你會看到模型開始思考(可能會有幾秒鐘的延遲),然後回應你。恭喜你!你已經成功在你的電腦上跑了一個 AI 模型。

要離開對話,輸入 /bye 並按 Enter 就行了。

不只聊天!進階玩法與模型推薦

跑起來只是第一步。Ollama 的魅力在於,你可以輕鬆切換不同的模型,來完成不同的任務。

換一個更強的模型

如果你覺得 gemma3:1b 有點笨,想要更聰明的模型,可以試試:

ollama run gemma3:12b

這會下載 120 億參數的版本,聰明程度會大幅提升。不過,請注意:你的電腦需要至少 16GB 的 RAM 才能順暢運行這個模型。如果你的電腦只有 8GB RAM,跑 7B 或 8B 的模型會是比較好的選擇。

另一個熱門選擇是 Meta 的 Llama 3 系列:

ollama run llama3.2:3b

這個模型在中文理解和生成上表現非常優秀。

不只是聊天,還能當你的程式碼助手

如果你寫程式,可以試試專門為程式碼設計的模型。例如我們在 Hugging Face 上看到的 yuxinlu1/gemma-4-12B-coder-fable5-composer2.5-v1-GGUF,雖然指令比較長,但 Ollama 支援直接從 Hugging Face 拉取模型。指令如下:

ollama run hf.co/yuxinlu1/gemma-4-12B-coder-fable5-composer2.5-v1-GGUF:Q4_K_M

這串指令看起來很長,但其實只是告訴 Ollama:「去 Hugging Face 的這個頁面,下載這個特定版本的模型。」Q4_K_M 是量化等級,代表一個在效能和大小之間取得平衡的版本。

安裝好後,你可以問它:「請用 Python 寫一個抓取網頁標題的函數。」它會給你完整的程式碼,而且因為是本地運行,完全不需要擔心程式碼被上傳到外部伺服器。

小技巧:如何管理你的模型

隨著你下載的模型越來越多,你可能會想要管理它們。以下是幾個實用的指令:

  • 查看已下載的模型:在終端機輸入 ollama list。它會列出你所有下載過的模型和它們的大小。
  • 刪除用不到的模型:輸入 ollama rm <模型名稱>。例如 ollama rm gemma3:1b
  • 一次下載,離線使用:Ollama 下載的模型檔案會存在你的硬碟裡。一旦下載完成,即使沒有網路,你也能使用 ollama run 指令來運行它們。

延伸閱讀

常見問題

Q: 我的電腦只有 8GB RAM,能跑什麼模型? A: 可以!建議從 gemma3:1bllama3.2:1b 這種 1B 參數的模型開始。它們非常輕量,8GB RAM 完全沒有問題。如果想挑戰稍微大一點的,可以試試 3B 的模型,但運行速度可能會稍慢。

Q: Ollama 需要 GPU 嗎?沒有獨立顯卡能跑嗎? A: 不需要 GPU。Ollama 預設使用 CPU 運行。沒有獨立顯卡也完全沒問題。差別在於,有 GPU 時模型回應速度會快很多;只用 CPU 的話,回應速度會慢一些,但功能完全一樣。

Q: 下載的模型檔案會佔多少空間? A: 看模型大小。一個 1B 的模型大約 0.6GB 到 1GB;一個 7B 的模型大約 4GB 到 8GB;12B 的模型則可能超過 10GB。建議確保你的硬碟有至少 20GB 的可用空間,這樣可以玩好幾個模型。

Q: 我可以把 Ollama 當成 ChatGPT 的替代品,每天拿來寫文章嗎? A: 可以,但要調整期望。本地模型(尤其是小參數的)在創意寫作和長文生成上,通常不如 GPT-4 或 Claude 3.5。但它們非常適合用來處理摘要、翻譯、程式碼生成等任務。對於注重隱私的工作,它們是無可取代的好幫手。

Q: 我下載了一個模型,但跑起來非常慢,怎麼辦? A: 這是正常現象。如果你的電腦沒有 GPU,模型會完全依賴 CPU 運算,速度會比較慢。你可以試試看更小參數的模型(例如從 12B 降到 3B),或是關閉其他程式釋放更多記憶體。

<script type="application/ld+json">
{
  "@context": "https://schema.org",
  "@type": "FAQPage",
  "mainEntity": [
    {
      "@type": "Question",
      "name": "我的電腦只有 8GB RAM,能跑什麼模型?",
      "acceptedAnswer": {
        "@type": "Answer",
        "text": "可以!建議從 gemma3:1b 或 llama3.2:1b 這種 1B 參數的模型開始。它們非常輕量,8GB RAM 完全沒有問題。如果想挑戰稍微大一點的,可以試試 3B 的模型,但運行速度可能會稍慢。"
      }
    },
    {
      "@type": "Question",
      "name": "Ollama 需要 GPU 嗎?沒有獨立顯卡能跑嗎?",
      "acceptedAnswer": {
        "@type": "Answer",
        "text": "不需要 GPU。Ollama 預設使用 CPU 運行。沒有獨立顯卡也完全沒問題。差別在於,有 GPU 時模型回應速度會快很多;只用 CPU 的話,回應速度會慢一些,但功能完全一樣。"
      }
    },
    {
      "@type": "Question",
      "name": "下載的模型檔案會佔多少空間?",
      "acceptedAnswer": {
        "@type": "Answer",
        "text": "看模型大小。一個 1B 的模型大約 0.6GB 到 1GB;一個 7B 的模型大約 4GB 到 8GB;12B 的模型則可能超過 10GB。建議確保你的硬碟有至少 20GB 的可用空間,這樣可以玩好幾個模型。"
      }
    },
    {
      "@type": "Question",
      "name": "我可以把 Ollama 當成 ChatGPT 的替代品,每天拿來寫文章嗎?",
      "acceptedAnswer": {
        "@type": "Answer",
        "text": "可以,但要調整期望。本地模型(尤其是小參數的)在創意寫作和長文生成上,通常不如 GPT-4 或 Claude 3.5。但它們非常適合用來處理摘要、翻譯、程式碼生成等任務。對於注重隱私的工作,它們是無可取代的好幫手。"
      }
    },
    {
      "@type": "Question",
      "name": "我下載了一個模型,但跑起來非常慢,怎麼辦?",
      "acceptedAnswer": {
        "@type": "Answer",
        "text": "這是正常現象。如果你的電腦沒有 GPU,模型會完全依賴 CPU 運算,速度會比較慢。你可以試試看更小參數的模型(例如從 12B 降到 3B),或是關閉其他程式釋放更多記憶體。"
      }
    }
  ]
}
</script>