人類漏看三分一威脅?AI Agent失控警號!

你有冇諗過,當你批准一個AI指令嘅時候,其實可能已經俾黑客入侵咗?

最新研究揭示咗一個令人不安嘅事實:人類喺審查AI Agent指令嘅時候,竟然漏看咗三分一嘅惡意威脅。呢個發現唔單止震撼咗成個AI安全社群,更加為企業同一般用戶敲響咗警鐘——當AI嘅自主性越來越強,我哋嘅警覺性係咪跟得上?

40,000場遊戲測試揭驚人真相

呢項由全球頂尖AI安全實驗室進行嘅研究,規模之大前所未有。研究團隊設計咗一個模擬真實環境嘅遊戲場景,邀請咗數百位參與者擔任「AI監督員」嘅角色,佢哋嘅任務係審查AI Agent執行任務時所發出嘅每一道指令,判斷當中有冇潛藏嘅惡意行為。

喺40,000場遊戲測試入面,結果令人震驚:人類參與者平均漏看咗三分一嘅威脅指令。換句話說,每三道惡意指令入面,就有一道可以成功通過人類嘅審查,直達執行階段。

更令人擔憂嘅係,研究發現人類嘅警覺性會隨住時間遞減。當測試進行到後半段,參與者嘅漏看率明顯上升,顯示出「警報疲勞」(alert fatigue)嘅現象——當人類面對大量指令需要審查嘅時候,反而會因為過度疲勞而降低警覺性。

呢個發現對於企業嚟講係一個重大警號。而家好多公司都開始採用AI Agent嚟處理客戶服務、數據分析、甚至財務交易等任務,但係如果人類監督機制本身就存在咁大嘅漏洞,AI Agent嘅安全性就要打上一個大問號。

AI Agent安全危機點樣解?

其實AI Agent嘅安全問題一直係業界關注嘅焦點。OpenAI、Google DeepMind等龍頭企業都不斷喺度研發更加安全嘅AI系統,但呢次研究揭示咗一個根本性嘅矛盾:AI Agent嘅效率越高,人類就越難有效監督佢哋。

目前市面上嘅AI Agent大致可以分為三類:

第一類係「完全自主型」,呢類AI Agent可以獨立完成整個任務流程,人類只係喺開始嘅時候設定目標,之後就完全交由AI自行決定執行方式。呢類型嘅AI Agent效率最高,但風險都最大,因為一旦AI被惡意指令入侵,人類幾乎冇機會及時制止。

第二類係「半自主型」,呢類AI Agent會喺執行重要步驟之前,先向人類監督員申請批准。雖然呢種模式提供咗一定嘅安全保障,但正如研究顯示,人類監督員嘅審查效率並唔可靠,特別係喺面對大量指令嘅時候。

第三類係「人工操作型」,所有指令都必須由人類手動執行,AI只係提供建議。呢種模式最安全,但效率最低,已經逐漸被市場淘汰。

業界專家認為,解決呢個問題嘅關鍵並唔係完全依賴人類監督,而係要建立多層次嘅安全防護機制。例如,AI系統本身應該具備「自我檢測」功能,當發現指令有可疑之處嘅時候,應該自動暫停執行並向管理員發出警報。

企業點樣自保?實戰指南

對於香港同台灣嘅企業嚟講,AI Agent嘅安全問題絕對唔可以輕視。根據統計,2025年全球因為AI系統被入侵而導致嘅經濟損失已經超過數十億美元,而且呢個數字仲喺度快速增長緊。

企業可以採取以下幾個實務措施嚟加強AI Agent嘅安全性:

第一,實施「雙人審查制度」。對於高風險嘅AI指令,例如涉及金錢交易或者客戶敏感資料嘅操作,應該由至少兩位管理人員共同審查先可以執行。雖然呢個做法會降低效率,但係可以大幅減少漏看嘅風險。

第二,建立AI指令日誌系統。所有AI Agent執行嘅指令都應該完整記錄落嚟,包括指令來源、執行時間、執行結果等資訊。一旦發現異常,就可以快速追溯問題根源。

第三,定期進行安全演練。企業應該定期模擬AI Agent被入侵嘅場景,測試員工嘅應變能力同安全意識。根據研究顯示,定期接受安全訓練嘅員工,佢哋審查AI指令嘅準確率可以提升將近四成。

第四,採用「AI監督AI」嘅模式。利用專門設計嘅安全AI系統,嚟監督其他AI Agent嘅行為。呢種「以AI制AI」嘅做法,可以補足人類監督嘅不足,提供24小時不間斷嘅安全防護。

延伸閱讀

AI Agent安全嘅未來:挑戰與機遇

展望未來,AI Agent嘅安全問題將會成為人工智能發展嘅核心議題。歐盟已經喺最新嘅《人工智能法案》入面,明確規定高風險AI系統必須具備完善嘅人類監督機制,而美國同中國亦都喺度制定類似嘅法規。

對於開發者嚟講,未來設計AI Agent嘅時候,必須將安全性納入核心考量,而唔係事後先嚟補救。例如,可以喺AI模型訓練嘅階段,就加入安全對齊(safety alignment)嘅機制,令AI本身具備辨別惡意指令嘅能力。

對於一般用戶嚟講,當你使用配備AI Agent功能嘅服務或者產品嘅時候,亦都要保持警覺。留意AI系統嘅權限設定,定期檢查AI嘅操作記錄,同埋避免將過多敏感資料交俾AI處理。

呢次研究嘅結果雖然令人擔憂,但同時都為我哋提供咗一個重要嘅機會——重新思考人類同AI之間嘅關係。AI Agent嘅發展方向唔應該係追求完全嘅自主性,而係要建立一個人機協作嘅模式,令AI嘅效率同人類嘅判斷力可以相輔相成。

隨住AI技術嘅快速發展,我哋好可能會喺未來幾年見到更加先進嘅AI Agent安全方案出現。但喺嗰一日嚟臨之前,保持警覺、建立完善嘅監督機制,先至係企業同用戶最穩陣嘅自保之道。