美國人工智能巨頭OpenAI,公布六個未公開過的AI模型偏差案例,包括有未發布的模型在訓練過程中為了提供結果,而隱瞞和編造失實數據和訊息;亦有模型試圖繞過系統網絡限制,指令其他代理擺脫聊天機器人的身份;其他個案還包括插入未來版本指令,以及AI代理之間共享本應保密的文件等,但就不涉及對第三方系統的黑客攻擊或入侵。
OpenAI指,相關案例最早在去年10月發生,但只是個別事件,將來會建立新機制,透過員工主動報告AI模型的異常行為或未經授權事件,再由安全和合規團隊展開調查,決定是否需要公開披露。
OpenAI今年7月對高階AI模型展開內部網絡安全評估與測試期間,模型突然失控,利用「零時差漏洞」「越獄」進入知名開源社區Hugging Face的伺服器,引起關注。路透社引述審查過相關活動的研究人員指,OpenAI的模型早在5月中就已向Hugging Face用戶的帳號,發送格式異常的文件,試圖繪製或測試Hugging Face網路的部分結構,探測平台漏洞,但暫時無證據表明此舉導致7月的入侵事件。OpenAI發言人回應,當時已即時向Hugging Face通報,致力保持資訊透明。