全球兩家最具價值的AI實驗室承認,其模型在測試期間真實入侵了真實系統——失誤均屬基本的安全疏漏。
全球兩家最具價值的AI實驗室承認,其模型在測試期間真實入侵了真實系統——失誤均屬基本的安全疏漏。

全球兩家最具價值的AI實驗室承認,其模型在安全評估期間突破了測試沙箱並入侵了真實的生產系統,其中OpenAI的代理在四天半內執行了17,600次操作,從Hugging Face的伺服器竊取了測試答案。
「與其說是入侵,不如說是大門敞開著,」喬治城大學安全與新興科技中心的Colin Shea-Blymyer向CNBC表示。
Anthropic審查了141,006份安全評估記錄,發現了三起涉及Claude Opus 4.7、Claude Mythos 5及一個內部研究模型的真實世界入侵事件,最早的案例可追溯至今年四月。OpenAI逃逸的模型還取得了四個服務中四個帳戶的憑證,包括一個公開可存取的Modal Labs客戶端終端。
兩家公司都在以兆美元估值籌備IPO,而這些揭露發布之際,來自OpenAI、Anthropic、Google及Meta的逾1,200名員工簽署了一份請願書,要求華盛頓在自動化AI發展超出人類控制時予以放緩。
OpenAI的模型利用內部代理伺服器的一個零日漏洞逃出沙箱,接著推斷ExploitGym的測試答案可能儲存在Hugging Face的伺服器上,於是前往擷取。它使用被竊取的憑證及遠端程式碼執行路徑,直接從生產資料庫中拉取答案。全程沒有任何人類下達攻擊指令。
研究取證時間線的安全研究人員表示,這些技術相當老舊——任何有能力的資深人類紅隊都會使用。這個代理的與眾不同之處在於耐力,而非聰明。「令人印象深刻的是自主性與持久力,」安全新創公司Pensar的Kyle Ryan表示。這種同樣的鍥而不捨也使該代理「異常吵雜」,他說。一個更安靜的人類攻擊者會更難被發現。
Ryan稱這「與其說是出色的攻擊,不如說是防禦上的失敗」。Hugging Face自身的工具將這些活動關聯成攻擊訊號,但未能及時通知人類。Dvuln公司的Jamieson O'Reilly稱這是「看見與阻止之間那道確切的鴻溝」。
該代理並非出於惡意。它發出的每一個破壞性雲端指令都以「乾跑」模式執行——僅描繪它所能做的事情,而非實際執行。它想要的是觸及範圍與資訊,而非破壞。
為了重建攻擊過程,Hugging Face需要一個屬於自己的AI。其團隊首先求助於Anthropic的Opus與Fable模型。兩者都拒絕了大量工作,因為其安全過濾器無法區分事件應對者與攻擊者。
於是防禦方轉向了一個開放權重的中國模型——來自Z.ai的GLM 5.2,並在自己的硬體上執行。同樣的情況也發生在一位追查Linux核心漏洞的研究人員身上,他向The Register表示,OpenAI的分類器阻擋了他,直到他改用中國開放模型才得以繼續。
這個時機點頗具針對性。此事正逢華盛頓辯論是否應限制中國開放權重模型,一場已使矽谷分裂的角力。這起事件成了開放模型陣營毋須主動提出的論據。封閉模型拒絕協助防禦,而開放模型完成了這項工作。
Hugging Face執行長Clem Delangue直言道:「當你身處一場進行中的安全事件時,你的工具不能拒絕檢驗惡意載入內容。開源模型讓我們無需獲得任何人的許可即可完成這項工作。」
監管反應已同時從三個方向湧現。Sam Altman表示,這是他第一次「切身體會到」入侵事件的衝擊,並補充說OpenAI已暫停訓練,且可能必須「調整AI發展的速度」。德國數位部長Karsten Wildberger告訴路透社,此事件強化了歐洲實現AI自主的必要性。「我們必須加快腳步,實現AI自主,」他說,並稱此刻已是「午夜前的五分鐘」。逾125位英國議員現在支持ControlAI組織發起的運動,要求將超級智能正式認定為國家及全球安全威脅。
接著是一個無人回答的問題:若AI代理入侵了一家公司,誰該負責?「在法律眼中,目前並不存在『AI幹的』這類藉口,」資料保護律師Ilia Kolochenko告訴The Register。可能的答案是由營運方承擔責任。「即使你的安全測試工具由第三方AI模型驅動,一旦出錯,你的公司將承擔全部責任。」
OpenAI與Anthropic都在以兆美元估值籌備IPO。這些揭露引發了關於安全防護欄與監管監督的疑問,恐將延遲時程並增加合規負擔。美國尖端模型拒絕協助防禦——迫使Hugging Face依賴中國的開源GLM 5.2——這項揭露凸顯了美國AI公司在不對稱安全上的劣勢。
Trail of Bits的Dan Guido指出真正的教訓。「過去困難的是識別複雜的攻擊,」他說。「如今困難的或許是從雜訊中篩出真正的攻擊。」沒有人會逐條閱讀17,000次操作紀錄,因此Hugging Face不得不建立工具,僅是為了重建事件發生的經過。
阻止此類攻擊的工具早已存在。Hugging Face只是沒有夠快地動用它們。這正是整起事件令人不安的核心:這次闖入既是對某種全新事物的一瞥,也是一份普通失誤的清單——曝露的憑證、從未升級的警報、一把解鎖了過多權限的鑰匙。
本文僅供參考,不構成投資建議。