
Hugging Face Not an Isolated Case? OpenAI Expands Investigation, Allegedly Finds More Signs of AI Agents 'Going Rogue'
據報道,除了已披露的智能體攻擊 Hugging Face 事件,OpenAI 目前還在調查其他的智能體脱離隔離環境案例,這些 “失控” 事件的影響有限,且沒有任何智能體離開 OpenAI 的網絡。OpenAI 和 Anthropic 均傳出智能體 “失控” 後,歐盟委員會稱與兩家公司展開溝通,認為有必要持續監測高風險 AI 系統。
OpenAI 有關 AI 智能體 “失控” 事件的調查仍在持續擴大。
據美東時間 31 日週五的媒體報道,在繼續調查此前智能體攻擊 Hugging Face 事件的過程中,OpenAI 發現了更多證據表明,除已披露案例外,還有其他 AI 智能體曾突破原本用於限制其行動的隔離環境(containment)。不過,OpenAI 目前尚未披露這些智能體來自自身還是其他機構,也未透露是否造成新的實際攻擊事件。
這一發現意味着,AI 智能體突破沙箱限制、獲得超出預期自主行動能力的現象,可能並非孤立事件。與此同時,歐盟委員會表示,已在 OpenAI 和 Anthropic 相繼披露智能體異常行為後,與兩家公司展開溝通,並強調有必要持續監測高風險 AI 系統。
OpenAI 在調查其他智能體脱離隔離環境 相關影響有限圍已擴大至模型更廣泛活動
路透援引知情人士消息稱,在持續調查 7 月發生的智能體網絡攻擊事件時,OpenAI 已將調查範圍擴大至更多內部評測及相關案例。
調查過程中,OpenAI 發現證據顯示,除此前公開披露的案例外,還有其他 AI 智能體曾突破原本用於限制其行為的隔離環境,目前也正在對這些案例展開調查。基於這一發現,OpenAI 正進一步擴大針對具備網絡攻擊能力模型的安全調查。
一位消息人士稱,上述其他智能體 “失控” 事件的影響有限,而且沒有任何智能體離開了 OpenAI 的網絡。
值得注意的是,路透並未説明這些 “其他 AI 智能體” 來自 OpenAI 內部還是其他機構,OpenAI 目前也未對此作出進一步説明。
對於最新調查進展,OpenAI 發言人向路透回應時,並未直接評論調查細節,而是引用了公司本週二發佈的一份聲明。聲明稱,除調查 Hugging Face 遭入侵事件外,公司還在審查 “我們模型更廣泛的活動”。這一表述也印證了 OpenAI 已將調查範圍從單一事件擴展至更多模型行為。
所謂 “突破隔離環境” 並非簡單生成危險代碼,而是指 AI 智能體繞過原本用於限制其行動範圍的沙箱、安全權限或網絡隔離措施,獲得互聯網訪問能力,並能夠自主調用工具、搜索信息、獲取憑據甚至訪問外部系統,以完成既定目標。
歐盟介入 稱與 OpenAI、Anthropic 展開溝通
隨着兩家美國 AI 公司相繼披露智能體異常行為,歐洲監管機構也開始密切關注事件進展。
路透同日報道稱,歐盟委員會表示,在 OpenAI 和 Anthropic 公開相關事件後,委員會已與兩家公司進行了溝通,並認為有必要持續監測高風險 AI 系統。
歐盟委員會發言人表示,目前沒有跡象顯示這些事件已構成《人工智能法案》(AI Act)所定義的"嚴重事件"(serious incident),因此尚未觸發法案規定的強制報告機制。
不過,歐盟委員會強調,將繼續與 AI 開發企業保持聯繫,密切關注高風險 AI 系統的發展情況,並根據掌握的信息決定是否需要採取進一步監管措施。
這是歐盟《AI 法案》正式進入實施階段後,監管機構首次就前沿 AI 智能體安全事件公開表態,也顯示監管關注點正從模型生成內容逐漸延伸至模型自主執行現實任務的能力。
OpenAI、Anthropic 均報告智能體異常行為
此次調查升級,源於 OpenAI 本週稍早首次公開披露的一起實驗性 AI 智能體網絡攻擊事件。
根據 OpenAI 此前説明以及多家媒體報道,一套用於網絡安全評測的實驗性智能體突破測試環境限制後,自主獲取登錄憑據並攻擊全球最大 AI 模型社區 Hugging Face,隨後還波及 AI 雲計算平台 Modal Labs 的一名客户賬户。此前報道稱,美國聯邦調查局(FBI)已介入瞭解相關情況。
與此同時,OpenAI 主要競爭對手 Anthropic 本週稍早表示,在覆盤約 14.1 萬次網絡安全測試後,公司確認至少發生過三起智能體自主攻擊其他組織網絡的案例。Anthropic 強調,這些事件均發生在受控測試環境中,沒有證據顯示模型在現實世界持續自主發動攻擊。
AI 安全關注點正從 “生成內容” 轉向 “自主行動”
隨着越來越多 AI 公司推出能夠自主編程、調用工具、管理服務器和執行復雜任務的智能體產品,業內對於 AI 安全的關注重點也正在發生變化。
過去幾年,大模型安全主要圍繞有害內容生成、模型幻覺和提示詞攻擊(Prompt Injection)等問題展開;如今,更受關注的是智能體是否會為了完成目標,自主突破權限限制、調用外部資源,甚至採取未經授權的網絡行動。
OpenAI 此次擴大調查,以及歐盟監管機構的最新表態,都顯示行業關注重點正從模型"説什麼",逐漸轉向模型"能夠做什麼"。如何確保 AI 智能體始終受限於既定權限邊界、不會突破隔離環境,正成為前沿 AI 競爭中新的安全焦點。
