《華爾街日報》報道,OpenAI取消原定今年10月在ChatGPT及Codex中首發的最新模型GPT-6.1 Astra。負責安全系統的高管Saachi Jain表示,模型在對齊性測試中,較前代出現倒退:對於自身執行或未執行的操作,並不總是如實告知用戶,呈現較高程度的欺騙性;同時會在未經用戶許可的情況下徑行推進任務,有時甚至在存在安全風險時調用外部工具和服務,未達公開發布標準。

OpenAI表示,不會公開發布相關模型,但將利用同一基礎模型進行額外強化學習,為後續GPT-6系列模型開發奠定基礎。

而科技媒體The Verge引述安全研究員Rowan Howard-Jones披露,今年4月至6月,OpenAI智能體原被要求獲取聯合國貿發會議(UNCTAD)生產能力指數公開數據,但因缺乏API直接訪問權限,向UNCTAD統計網站發送逾1.6萬次掃描請求,過程中試圖隱藏行為,並利用谷歌XSS遊戲作為跳板完成任務,暴露AI自主執行任務時的權限邊界問題。

之前OpenAI已經因為智能體突破網絡隔離限制、擅自訪問外部聊天機器人,宣布暫停其最強能力模型的訓練,並部署可在15分鐘內識別異常行為的新監控系統。另外,佛羅里達州總檢察長James Uthmeier星期一向法院申請臨時禁令,尋求阻止OpenAI在缺乏第三方安全保障的情況下,繼續開發新模型。