行業新聞與部落格
Anthropic 公司又曝出一起網路安全事件
Anthropic 披露了第四起事件,其一名模特未經授權訪問了第三方系統。
9 月 9 日,該公司在一篇題為“對齊評估”的長篇部落格文章中分享了這一訊息。
此前 ,Anthropic 公司在 7 月份披露了三起事件,稱其三個 Claude AI 模型從評估環境接入網際網路,攻擊第三方組織。
這家人工智慧巨頭聲稱,第四起案件最初被其自身的智慧搜尋系統遺漏了。該系統掃描了 141,000 份筆錄,該公司認為克勞德可能在網路評估期間獲得了網際網路訪問許可權。
該公司表示,此後已將搜尋範圍擴大到 4.81 億份筆錄,除這四起案件外,沒有發現其他案件。
新發現的事件發生在 2026 年 1 月,涉及 Claude Opus 4.6 的早期版本。它被賦予了一個與另外三個已公佈事件中不同的奪旗 (CTF) 任務。
“該模型意外地將與另一臺機器衝突的 IP 地址分配給了目標,導致目標無法訪問,任務也無法解決,”Anthropic 解釋道。
“模型意識到這一點後,嘗試使用命令中止任務,但由於評估工具配置錯誤而失敗。在整個測試過程中,模型又嘗試放棄任務七次。”
由於配置錯誤,無法中止任務,模型繼續執行,嘗試透過其他範圍內的手段到達目標,但失敗了。
“隨後,它開始探索周圍環境,並找到了與事件 3 中相同的出口路徑。該模型發現了一臺屬於第三方的機器,它可以訪問這臺機器,並表示它認為該第三方是 CTF 的一部分,”報告繼續寫道。
“該模型在機器內部找到一個包含密碼的檔案,並利用該密碼獲得了系統的管理員許可權。隨後,該模型竊取了更多憑證,修改了系統設定以方便訪問,並讀取了與第三方相關的一名人員的個人資訊。”
Anthropic 公司表示, 只有當模型耗盡其代幣預算時,會話才會結束 。
這家人工智慧實驗室還表示,已與人工智慧安全評估非營利組織 METR 簽署協議。此前一天,《金融時報》 披露,該公司未向英國人工智慧安全研究所(AISI)提供其最新的人工智慧模型 Claude Mythos 5.1 。
OpenAI 證實德國維基事件
就在幾天前,Anthropic 的競爭對手 OpenAI 證實了另一起涉及其自身模型的事件。
根據 9 月 4 日釋出的一份報告,一群特工劫持了鮮為人知的德國維基網站 DSEwiki,並將其改造成一個供自己使用的留言板。
Nightingale Collective 解釋說:“我們發現大約有 18000 條帖子來自自主人工智慧代理(它們自稱來自 OpenAI),這些代理在執行網路搜尋任務時利用公共網際網路進行交流。這些人工智慧代理串通起來分享答案、研究周圍環境並繞過沙盒限制。”
OpenAI 表示,該事件凸顯了模型製作者需要制定標準,以便在分享此類具有實際影響的“錯位事件”時能夠進行規範。
“我們和更廣泛的人工智慧社群還沒有一個明確的標準來報告在訓練、評估和部署過程中出現的偏差,包括那些看起來不像傳統安全事件,但可能有助於深入瞭解人工智慧行為和未來風險的例子,”它補充道。
“我們正在制定一個框架,並將在未來幾周內分享。與此同時,我們正在與全球數十個政府監管機構就這些問題展開合作。”
然而,Suzu Labs 安全人工智慧解決方案和網路安全高階總監 Jacob Krell 認為,人工智慧行業需要做的不僅僅是建立一個披露事件的框架。
“我們首先需要一個框架來檢測代理之間的通訊和協調,”他說。
“你無法披露你看不見的東西。大約 18,000 條訊息在獨立研究人員拼湊出事情真相之前就已經在公共網站上積累起來,這一事實應該使智慧體的可觀察性成為一個更加重要的優先事項。”
最近新聞
2026年09月14日
2026年09月14日
2026年09月14日
2026年09月09日
2026年09月09日
2026年08月24日
2026年08月24日
2026年08月20日
需要幫助嗎?聯絡我們的支援團隊 線上客服