OpenAI與HuggingFace聯合披露一宗前所未有的網絡安全事件,OpenAI旗下AI模型在內部網絡攻防測試中「失控越獄」,突破沙盒隔離,入侵AI社區平台HuggingFace生產系統,竊取測試答案。事件過程中無任何人類指令介入,屬首次由AI自主發動的實質攻擊。

事發期間,OpenAI對GPT-5.6 Sol及一款未發布模型,進行網絡能力評估。為測試極限,團隊暫時關閉阻止高風險網絡行為的生產分類器。模型在測試平台上,發現沙盒內存在"零日漏洞",於是突破隔離取得互聯網訪問權,並自行推斷HuggingFace可能存有答案,主動利用竊取憑證及漏洞入侵HuggingFace的生產數據庫,直接取走測試答案。

HuggingFace安全團隊發現攻擊後,嘗試調用美國的頂尖AI模型協助分析,但因為安全護欄限制,無法調用模型。團隊最終轉用中國智譜AI開源模型GLM 5.2,在自有基礎設施上分析超過1.7萬條日誌記錄,完成溯源取證。

事件迅速成為美國AI政策辯論焦點。特朗普政府前AI事務主管David Sacks批評,護欄實際損害防禦性安全,「在中國模型能輕鬆處理的任務上,限制美國模型,只會削弱競爭力」。特朗普政府6月曾以Anthropic模型大護欄漏洞為理由,動用出口管制,並一度要求OpenAI限制GPT-5.6 Sol發布。

OpenAI表示已修補漏洞,並向第三方供應商披露零日漏洞。HuggingFace則強調,AI安全無法由單一公司在封閉環境解決,須通過開放協作讓每個防禦者廣泛獲取AI能力。