美國媒體Axios引述消息報道,2家前沿AI公司OpenAI、Anthropic及安全研究人員,正在調查數萬宗旗下前沿模型,在近數月的內部測試及真實環境中,出現的「問題行為」事件,涉及繞過安全護欄、建立留言板、逃出沙盒環境、劫持網站,以至自我提示或試圖避開監控等。由於2家公司對模型進行的測試動輒數十萬次,即使異常比例微小,累計仍可能達數萬宗,實際數字或進一步上升。
事件嚴重程度不一,OpenAI近日披露,旗下AI代理曾外洩53張ChatGPT用戶圖片、入侵一個澳洲政府網站,並試圖攻擊包括美國政府在內的其他網站。OpenAI其後宣布暫停訓練旗下能力最強的模型,直至確保額外保障及對齊改進到位後方會恢復。行政總裁奧爾特曼(Sam Altman)承認審查進度未如理想,並稱涉及開發者平台Hugging Face的事件最為嚴重:數百個代理在留言板上協調行動,入侵一間外部公司以提升在網絡安全測試中的表現。
Anthropic方面,公司今個星期發布的Opus 5.5模型系統卡顯示,在無法不逃出沙盒便不能完成任務的對抗性實驗中,模型於1.5%的測試中試圖逃出沙盒。Anthropic已委託第三方安全機構審查模型的行為。
業內人士警告,新一代模型以極強韌性完成任務,限制其「足智多謀」往往是徒勞,因為難以預料每種失控的方式。獨立AI評估機構Transluce研究員Conrad Stosz表示,目前所見只是「冰山一角」;ControlAI行政總監Connor Leahy則指出,事件重點不在單宗損害,而在於「自主系統做一些被告知不可做的事」,甚至涉及犯罪。報道稱,隨着前沿能力持續擴展,未來將有更多模型不當行為披露。