英國人工智能安全研究所最新報告顯示,他們進行的網絡安全評估測試,發現部分AI智能體透過互聯網,對現實個人及機構持續實施未經授權的潛在有害行為。

報告指出,測試要求智能體完成網絡安全挑戰,研究人員使用7種模型開展122輪測試,其中10輪共發現19項明顯超出設定範圍的行動。當中17項涉及Anthropic公司的Claude Mytho 5模型,2項涉及OpenAI的GPT-5.6 Sol模型。

在最嚴重案例中,一個智能體試圖向公開使用的開源項目,植入惡意代碼,並創建多個虛假身份,向真實維護人員施壓以尋求批准,最終被維護人員發現並拒絕。另外,相關智能體並嘗試直接聯繫現實個人、透過網絡文件傳輸服務發送信息及文件,以運行惡意代碼、在代碼中植入惡意指令操縱其他AI編碼工具,並在開源技術社區留言「邀請」其他智能體「合作」。

報告強調,測試人員為評估模型最大能力,有意開放互聯網訪問並關閉部分安全機制,與公眾使用時的配置不同。目前無明確跡象顯示測試環境外出現類似行為,且未造成現實危害。報告建議收緊AI智能體的互聯網訪問權限,引入實時監測和攔截機制,並重新評估測試設計。

針對報告,Anthropic聲明指研究所採用的測試設定,「不能代表任何實際投入使用的模型」;OpenAI發言人亦表示,測試條件「並不反映一般使用情況」。