Top AI Loses Control Again! Anthropic's Claude AI Actually Hacked Into Three Companies' Systems During Testing

華爾街見聞
2026.07.31 15:35

Anthropic 旗下 AI 模型 Claude 在網絡安全測試中,因配置失誤錯誤連接公共互聯網,對三家外部機構基礎設施實施未經授權訪問,最早入侵可追溯至 4 月。事件在 OpenAI 披露類似事故後經內部審查曝光。兩起事故引發業界對 AI 安全管控的質疑,並促使逾 1100 名從業者聯署呼籲美國政府加強監管。

Anthropic 旗下人工智能模型 Claude 在網絡安全測試中因配置失誤意外入侵三家外部機構,這一事件與競爭對手 OpenAI 近期披露的類似事故相互疊加,令 AI 行業的安全管控能力受到嚴峻拷問。

據彭博,Anthropic 於 7 月 30 日在一篇博客文章中披露,其 Claude 模型在"奪旗"(capture-the-flag)網絡安全測試中,因測試環境錯誤連接至公共互聯網,導致對三家外部機構的真實基礎設施實施了未經授權的訪問。最早的入侵事件可追溯至今年 4 月。Anthropic 表示,此次披露源於其在 OpenAI 上週公開類似事故後主動啓動的內部審查。

此次事件發生在 OpenAI 披露其 AI 模型在安全測試中"失控"併入侵 AI 公司 Hugging Face 基礎設施僅數日之後,兩起事故接連曝光,已促使部分美國政界人士呼籲對 AI 技術實施聯邦層面的監管。與此同時,據彭博,逾 1100 名 AI 行業從業者於本週二聯署請願,呼籲美國政府建立機制以"有意識地控制"AI 發展節奏。

配置失誤打開安全缺口

Anthropic 表示,此次事故的根源在於其與評估合作伙伴、AI 安全公司 Irregular 之間的溝通誤解。在所有涉事測試中,Anthropic 均向 Claude 明確説明其所處環境為模擬環境且無法訪問互聯網,但實際上測試系統仍與公共互聯網保持連接。

"由於我們與評估合作伙伴之間存在誤解,實際情況並非如此,"Anthropic 在博客中寫道。Irregular 發言人表示,該公司對 Anthropic 的合作與透明度表示讚賞,並稱調查仍在進行中。

涉事的三個模型分別為 Claude Opus 4.7、Claude Mythos 5 以及一個內部研究測試模型,均在缺乏公開工具通常配備的標準安全防護措施的環境下運行。Anthropic 指出,Claude 利用弱密碼和未經身份驗證的端點等基礎技術入侵了上述機構的基礎設施。

值得關注的是,在模型行為上,較舊的模型在獲得已連接至公共互聯網的證據後仍繼續發動攻擊,而 Anthropic 最新模型在識別出自身處於互聯網環境後則主動停止了行動。

事後審查揭示監控盲區

Anthropic 表示,其於 7 月 23 日開始審查評估記錄,並在當天發現 Claude 可能已訪問互聯網的證據後,立即暫停了所有網絡安全評估工作。公司於 7 月 24 日確認全部三起事件,並於 7 月 27 日通知了受影響機構。

此次審查共涵蓋 141006 個測試會話。Anthropic 坦承,在事件發生時,公司與受影響機構均未察覺到這些入侵行為,並承認本可對網絡日誌和評估記錄進行更為嚴格的審查。

三家受影響機構均未在博客中具名。其中兩家機構在被 Anthropic 聯繫之前對相關活動毫不知情。

行業安全標準面臨重新審視

Surrey 大學網絡安全教授 Alan Woodward 表示,Anthropic 對導致此次事故的人為失誤持坦誠態度。"AI 並沒有失控——你要求它做某件事,然後把門敞開了,"他説,"我認為 Anthropic 承認了這一點。"

Anthropic 在博客中表示,此次事件揭示了若干重要教訓,包括涉及強大自主能力的測試同樣需要嚴格的管控措施。"安全測試之所以在模型發佈前進行,正是因為我們尚不完全瞭解其能力所及,"公司表示,"評估環境越來越需要達到與模型實際運行的任何其他系統相同的安全標準。"

此次事件發生在 Anthropic 宣佈推出功能強大且潛在風險較高的 Mythos 模型並對其發佈實施嚴格限制後約四個月。兩起 AI 安全事故的接連發生,正推動業界重新審視 AI 測試環境的安全標準,並加速外部監管討論的進程。