延伸閱讀

找東西超快!|Nvidia這招太狠了

Nvidia 又出手了,這次不是顯卡,而是一個讓找東西變得像呼吸一樣簡單的 AI 模型——LocateAnything-3B

這款模型過去一週在 HuggingFace 上瘋狂吸粉,獲得 2100 個讚,下載量逼近 10 萬次。更嚇人的是,它不需要昂貴的 GPU,在一般手機或筆電上就能順暢運行。消息一出,整個開源社群都炸了。

「這東西太扯了,我用手機拍了一張亂到不行的桌面,它一秒鐘就幫我找到那支該死的筆。」一位 Reddit 使用者在 r/MachineLearning 上驚嘆。

到底是什麼神奇技術?

LocateAnything-3B 的名字已經說明了它的核心能力——定位任何東西。傳統的物件偵測模型(如 YOLO、Faster R-CNN)需要針對特定類別進行訓練,例如人、車、狗。但 LocateAnything-3B 不一樣,它屬於「開放詞彙物件定位」模型,意思是你只要用自然語言描述你要找的東西,它就能在圖片中標出位置

舉個例子:你拍了一張倉庫貨架的照片,然後輸入「紅色包裝的螺絲釘」,模型會立刻在圖片上用邊界框標出所有符合條件的螺絲釘。不需要預先訓練,不需要標註資料,一句話就搞定

這背後的技術基礎來自 Nvidia 的「視覺語言模型」研究。LocateAnything-3B 其實是一個 30 億參數的模型,結合了視覺編碼器和語言理解能力。它能夠將文字描述與圖像中的視覺特徵進行對齊,從而實現精準定位。

根據 Nvidia 官方公布的數據,在 RefCOCO、RefCOCO+、RefCOCOg 等標準基準測試中,LocateAnything-3B 的表現超越了同等規模的開源模型,甚至在某些指標上逼近了更大的模型(如 7B 參數級別)。

更關鍵的是,Nvidia 使用了 先進的模型壓縮技術,將模型大小控制在 3B 參數,但性能幾乎沒有損失。這意味著它可以在 4GB 記憶體的設備上運行,甚至 iPhone 15 Pro 以上的手機也能勝任。

香港台灣的企業能用來做什麼?

對於香港和台灣的企業來說,LocateAnything-3B 的出現打開了無數應用場景的大門。

零售業:庫存管理大革命 想像一下,一個倉庫管理員拿著手機對著貨架掃一圈,然後說「找出生產日期在 2026 年 3 月之前的奶粉」,模型立刻標出所有需要下架的產品。這比傳統的條碼掃描或 RFID 標籤快上十倍,而且不需要任何硬體升級。

香港的連鎖超市和台灣的便利商店每天都要處理大量的庫存盤點。目前的做法是員工拿著手持終端機,一個一個掃描商品條碼。如果改用 LocateAnything-3B,盤點時間可以從數小時縮短到十幾分鐘

醫療領域:X光片輔助診斷 雖然 LocateAnything-3B 不是專門為醫療影像設計的,但它的開放詞彙定位能力讓醫生可以用自然語言查詢醫學影像。例如,放射科醫師可以輸入「右肺上葉的結節」,模型就會在 CT 掃描圖上標出疑似病變區域。

台灣的台大醫院和香港的瑪麗醫院每年處理數百萬張醫學影像。如果將 LocateAnything-3B 整合到 PACS(醫學影像儲存與傳輸系統)中,可以大幅減輕醫師的負擔,提高診斷效率

製造業:品管檢測自動化 工廠生產線上的產品缺陷檢測一直是 AI 的熱門應用。傳統做法需要收集大量缺陷樣本,訓練專門的模型。有了 LocateAnything-3B,品管人員只需描述缺陷類型,例如「螺絲鬆動」或「外殼刮傷」,模型就能即時在生產線影像中標出問題產品。

香港的電子產品代工廠和台灣的半導體封測廠,每天都有數以萬計的產品需要檢測。引入 LocateAnything-3B 可以將品管流程從「訓練模型」轉變為「描述問題」,大幅降低導入門檻。

開源生態的下一步棋

LocateAnything-3B 的爆紅,不只是因為它好用,更是因為 Nvidia 選擇了完全開源。模型權重、推理程式碼、甚至訓練腳本都公開在 HuggingFace 上。這與許多科技巨頭「開源但不完全開源」的做法形成鮮明對比。

過去一週,GitHub 上已經出現了 超過 20 個基於 LocateAnything-3B 的專案。有人用它做自動化購物清單識別,有人整合到機器人系統中讓機械臂自動抓取指定物品,甚至有人用它來幫視障人士「看」東西。

一位來自台灣的開發者在 GitHub 上分享了他的專案:「我把 LocateAnything-3B 部署在 Raspberry Pi 上,接到一個 USB 攝影機,然後寫了一個 LINE Bot。我媽只要拍照傳到 LINE,說『找我的老花眼鏡』,機器人就會回傳標註好的圖片。她現在每天都用。」

這種「即用即走」的特性,讓 LocateAnything-3B 不僅僅是一個學術模型,而是真正能落地到日常生活中的工具。

與競爭對手的比較

市面上不是沒有類似產品。Google 的 OWLv2Microsoft 的 Florence-2 都具備開放詞彙定位能力。但 LocateAnything-3B 的優勢在於:

  1. 體積更小:3B 參數 vs. Florence-2 的 5.4B 參數,運行門檻更低。
  2. 開源程度更高:Nvidia 連訓練資料的處理流程都公開了,這在業界非常罕見。
  3. 社群支援強:HuggingFace 上已經有大量的範例程式碼和整合指南。

缺點也不是沒有。LocateAnything-3B 在處理極度相似物體(例如同一貨架上不同口味的飲料)時,準確率會下降。另外,它對模糊或低解析度圖片的表現不如預期。

接下來要注意什麼?

LocateAnything-3B 的爆紅,預示著一個更大的趨勢:AI 模型正在從「通用型」走向「專用型」。過去我們需要一個巨大的模型來處理所有任務,現在則是可以根據需求,選擇小模型來完成特定工作。

對香港和台灣的讀者來說,這意味著:

  • 企業導入 AI 的成本正在急劇下降。不需要買幾十萬的 GPU,一台筆電就能跑。
  • AI 應用將變得更加個人化。你可以根據自己的需求,微調一個專屬模型。
  • 開源社群的力量正在超越大公司。LocateAnything-3B 一週內就催生了數十個應用,這是任何封閉平台都做不到的。

Nvidia 這一手,不僅僅是秀肌肉,更是在下一盤很大的棋。當每個人的手機都能跑 LocateAnything-3B,當每個企業都能輕鬆部署物件定位功能,Nvidia 的 GPU 生態系統將會變得更加穩固。

而我們,正站在這個變革的起點。