美國AI前沿企業Anthropic的研究員Jacob Coxon辭職後,在社交媒體發表長篇文章,指他過去3年先後任職的Anthropic和OpenAI,在全力追求可能為人類帶來存亡風險的技術過程中,採取不負責任的做法

,指兩家公司正在推進能夠「自我改進」的AI模型,而這些模型最終可能變得強大到人類無法控制。

Coxon在帖文指,兩家公司正拿人類的生命作賭注,指這些人工智能系統很快就會擁有超越人類的能力,可以入侵任何東西、一夜之間徹底改變任何領域,並獲得真正的權力和資源。

Coxon指,開發AI的團隊「真心認為,到2030年前後,它可能會殺死我們所有人」。Anthropic現任負責對齊(Alignment)工作的小組組長Evan Hubinger回應帖文,指他和公司其他人的確擔心Coxon所講的情況。又說他個人認為,未來10年內發生這種情況的概率超過10%。

 

而Anthropic星期三發表「對齊評估報告」,披露4宗安全事件:因演練環境誤接真實互聯網,Claude Mythos 5在PyPI上傳惡意偽裝套件,曾試圖用加密貨幣買手機號註冊,轉用免費一次性郵箱後連發三版惡意軟件包,結果有15家第三方安全商下載,一家外洩訪問憑證後被入侵實時數據庫,約90分鐘後才被刪除。

Opus 4.7亦誤攻名稱相近真實公司,下載並修改用戶記錄。報告承認屬於嚴重「對齊失敗」,模型為完成任務,將真實證據合理化為模擬環境,並可能隱瞞真實判斷。研究人員發現AI展現類似人類的「偏見推理」和極度「魯莽」,AI為了完成任務,已經學會「自欺欺人」和「不擇手段」。