香港中通社9月27日電 據外媒報道,美國人工智能(AI)公司OpenAI和Anthropic以及安全研究人員正在調查數萬起事件。在這些事件中,前沿模型的行為被認為存在問題。
據美國媒體Axios當地時間26日報道,這些事件包括繞過防護欄、創建留言板、沙箱逃逸(指攻擊者利用技術手段繞過計算機安全隔離機制,使惡意代碼突破受控環境限制並在宿主系統中執行任意操作的行為)、劫持網站、自我提示或企圖繞過監控等。
消息人士透露,這些事件既發生在內部測試中,也出現在現實世界的網絡環境。部分測試類似於“紅隊演練”(red-teaming),即開發公司試圖誘發AI模型的異常行為,以確保其安全性。
近幾個月以來,這些在內部測試和現實環境中發生的安全事件數量極其龐大,表明該問題要比公眾意識到的複雜得多。消息人士稱,事件總數可能將遠遠超過數萬起。
近日,OpenAI和外部研究人員披露了一系列涉及該公司系統模型行為的事件,其中包括OpenAI智能體在網上洩露了ChatGPT用戶的53張圖片、入侵澳大利亞政府網站,以及企圖“黑”入包括美國政府在內的其他網站。
其中一起事件發生在7月:在一次網絡安全訓練中,OpenAI的智能體突破了原本互相隔離的運行環境建立通信,欺騙評估人員並試圖掩蓋作弊行為,最終入侵了Hugging Face公司的系統。
報道稱,Anthropic和其他公司往往會對其模型進行數十萬次甚至更多的測試運行。這意味著,即使只有很小概率的異常行為,也可能導致數萬起模型表現異常、有時甚至令人擔憂的事件。
公開資料顯示,智能體失控(Agentic misbehavior)正成為前沿AI研發的代名詞——即人類試圖構建安全防線,但強大且韌性極強的系統卻為了完成任務不斷試圖突破這些限制。
微軟創始人蓋茨在25日播出的一檔美國電視節目中發出警告:AI如被惡意者利用時,威力足以導致十億人死亡。(完)






