一間公司花錢教AI「做人」,卻留不住教它的人

2026年10月初,兩則關於 Anthropic 的消息幾乎同時在矽谷流傳。第一則,是《紐約時報》風格的深度報導,描述這家以「安全」為品牌核心的AI公司,如何投入大量研究資源,試圖把一套可辯護的道德框架「灌」進 Claude 系列模型裡——不是靠事後過濾,而是從訓練階段就讓模型學會拒絕、學會解釋、學會在不確定時說「我不確定」。

第二則,是該公司安全部門主管閃電離職,並公開警告公司內部文化「已經壞掉(broken)」。兩件事放在一起,構成一幅極具諷刺意味的產業縮影:全世界最認真教AI道德的公司,連自己的道德團隊都留不住。

對香港與台灣的企業來說,這不只是矽谷八卦。它觸及一個正在成形的採購現實:當你簽下一紙AI服務合約,你買的不只是模型能力,還買進了供應商的價值觀、治理能力與人事穩定度。而這些,目前幾乎沒有任何人寫進報價單裡。

對齊(Alignment)到底是什麼?為什麼企業該在乎

先講清楚技術面。所謂「AI對齊」,指的是讓模型的行為符合人類意圖與社會規範的一整套工程手段。Anthropic 的做法大致分三層:

第一層是訓練階段的價值注入,透過人類回饋與憲法式AI(Constitutional AI)等方法,讓模型在生成回應前先自我檢查。第二層是部署階段的防護欄,包括拒絕高風險請求、標註不確定性。第三層是治理層,也就是誰有權修改這些規則、修改紀錄是否可追溯。

對企業而言,第三層才是真正的地雷區。因為前兩層是技術問題,第三層是合約與責任問題。

舉個具體場景:一家香港保險公司用大語言模型做初步理賠分類。如果模型因為供應商某次「對齊更新」而改變了拒絕理賠的門檻,導致客戶申訴,責任在誰?目前多數合約寫的是「模型輸出僅供參考」,但當企業把模型接進正式流程,這句話的保護力正在快速蒸發。

數字會說話:對齊成本 vs. 企業風險成本

根據產業公開資料與開發者社群的觀察,頭部實驗室投入對齊研究的團隊規模,已從2023年的數十人,膨脹到2026年的數百人等級,佔整體研究人力的兩到三成。換算成薪資與算力成本,這是一筆每年數億美元等級的支出。

企業端呢?根據多家跨國顧問機構近期的企業AI調查,受訪企業中約有六成表示「模型行為的可預測性」是採購時的關鍵考量,但只有不到兩成表示自己有能力實際稽核供應商的對齊更新紀錄。這是一個巨大的資訊落差:企業很在乎,卻幾乎無法驗證。

更現實的是,當供應商內部出現人事震盪——尤其是安全、對齊、治理相關職位——模型的長期行為穩定性就會被打上問號。這次 Anthropic 安全主管的公開離職,正是把這個風險從「理論」變成「已發生」。

香港與台灣企業的三個實務盲點

盲點一:把「安全」當成行銷詞,而非合約條款。 多數港台企業在評估AI供應商時,看的是準確率、延遲、價格與資料落地區域。安全與對齊往往被歸類為「供應商自己會處理」。但當模型行為改變造成業務損失,合約裡通常找不到對應條款。

盲點二:忽略人事穩定度的訊號價值。 一家公司如果連續流失安全與治理主管,這與財務報表上的警訊同等重要。矽谷的經驗是:對齊團隊的流動,往往領先於模型行為的漂移。港台企業在盡職調查時,幾乎沒有人在看這一塊。

盲點三:沒有內部對齊負責人。 企業導入AI時通常設有IT負責人、資料保護負責人,卻極少設「模型行為負責人」。結果就是當模型輸出引發客訴或法遵問題時,沒有人能說清楚「這是不是我們預期的行為」。

給企業的具體行動清單

第一,在合約中加入模型變更通知條款。要求供應商在重大對齊更新前提供通知與變更說明,並保留終止或調整合約的權利。這在雲端服務合約裡已有先例,AI合約沒有理由例外。

第二,建立模型行為的內部基準線。用一小組固定測試案例,定期對接取的模型做回歸測試。這不需要龐大資源,一週一次的腳本化測試就能抓到明顯漂移。

第三,把供應商的治理人事納入年度評估。不是要你追蹤每個人的去留,而是觀察趨勢:安全團隊是否持續擴編?治理政策是否公開更新?離職是否伴隨公開警訊?

第四,為高風險流程保留人工覆核層。對齊做得再好,都不該成為把最終決策權完全交給模型的理由。這不是技術保守,而是責任設計。

延伸閱讀

結語:道德不是贈品,是採購項目

Anthropic 的故事告訴我們一件反直覺的事:AI的道德不是訓練出來的靜態資產,而是需要被持續維護的組織能力。 當維護它的團隊本身都不穩定,模型再怎麼「學會做人」,也只是暫時的。

對港台企業而言,這是一個提早卡位的機會。當多數競爭者還在比價格與準確率,誰先把「對齊治理」寫進採購流程,誰就先拿到下一階段的信任紅利。畢竟,客戶不會問你的AI用哪個模型,他們會問:當它出錯時,你找得到人負責嗎?