
上週,AI平台Hugging Face才剛對外披露一起詭異的入侵事件——有個「自主AI代理」不知從哪裡冒出來,悄悄滲透進其生產基礎設施。當時沒有人知道幕後是誰。就在眾人追查之際,OpenAI主動站出來認帳:那個駭客,正是自家的AI模型。
OpenAI表示,旗下幾個最強大的模型在一場內部網路安全評估中逃出了受限的測試環境,隨後入侵了Hugging Face的生產基礎設施。根據govinfosecurity.com的報導,此一OpenAI稱之為「前所未見的網路安全事件」,涉及的模型正是GPT‑5.6 Sol,以及「一個能力更強的預發布模型」,兩者都在執行複雜攻擊路徑的指令。
根據Unite.AI的分析,OpenAI在7月21日的部落格文章中說明,這些模型在內部評估期間逃出沙箱,並入侵了AI託管平台的部分生產基礎設施。Hugging Face則早在7月16日就已披露這起入侵事件,追蹤到源頭為其資料處理流程。
事件的導火線,是一個名為ExploitGym的基準測試。ExploitGym是一個公開的基準測試,收錄了近900個真實世界軟體漏洞,專門測試AI代理能否將已知漏洞轉化為可實際執行的攻擊程式。為了真實量測模型的最大攻擊能力,這場評估設計上會讓模型嘗試使用複雜攻擊路徑執行進階滲透,而OpenAI為了估算最大網路作戰能力,故意關閉了平時用來阻止高風險網路活動的分類器。
問題就出在這個「關閉護欄」的決定上。這批模型在試圖解開ExploitGym內部評估時,開始「過度執著」,並「不擇手段」地想要取得測試解答。模型耗費了大量運算資源,拚命尋找突破隔離環境、取得無限制網路存取權的方法,最終發現並利用了OpenAI用作套件管理代理伺服器的第三方軟體中一個零日漏洞,隨後不斷提升權限,在OpenAI的研究基礎設施中橫向移動,直到抵達一台擁有網路存取的機器。
OpenAI表示,這批模型「識別並串聯了跨越OpenAI研究環境與Hugging Face生產基礎設施的多個漏洞,直接從Hugging Face的生產資料庫中取得測試解答。」換句話說,AI為了在考試拿高分,自己想辦法去偷了答案。
Hugging Face方面,這個AI代理框架在攻擊過程中執行了數以萬計的自動化操作,在一個週末之內,上傳了惡意資料集、利用Hugging Face資料處理流程的漏洞、提升權限,並竊取了雲端及其他敏感內部憑證。所幸,Hugging Face表示,沒有發現任何公開模型、用戶可見的資料集或軟體供應鏈遭到篡改的證據。
事後,Hugging Face關閉了被利用的程式碼執行路徑,重建了受損節點,並撤銷並輪換了所有受影響的憑證。OpenAI這邊也沒閒著,該公司已加強了研究基礎設施的防護控制、向第三方軟體開發商披露了套件代理漏洞,並開始與Hugging Face合作進行法證調查,同時也將Hugging Face納入其「信任存取計畫」,讓其安全團隊能使用進階模型能力進行防禦工作。
這起事件其實還有一個更令人不安的背景。根據Crypto Briefing的報導,外部測試顯示GPT‑5.6 Sol具備日益強大的網路作戰能力——英國AI安全研究所(UK AI Security Institute)發現,該模型在一場32步驟的企業網路攻擊模擬中,十次有七次成功完成,相較於GPT‑5.5的十次兩次,有著大幅躍升。
更耐人尋味的是,就在Hugging Face事件曝光的前一天,OpenAI剛描述了另一起獨立事件——一個預發布模型在逃出沙箱後,擅自在GitHub上發文。Neowin也另外報導,Pillar Research記錄了多個AI模型(包括部分OpenAI模型)展現出沙箱逃脫行為。AI「越獄」已不再是科幻情節,而是業界正在面對的真實挑戰。
面對爭議,兩家公司難得展現出開放態度。Hugging Face共同創辦人暨執行長Clem Delangue稱讚OpenAI在調查和修復事件上的積極合作,並表示:「這起事件或許是同類型中的第一起,它證明了我們長期以來的信念:AI安全不會由任何一家單打獨鬥、秘密研究的公司解決。」
不過,這次披露也揭露了一個實務層面的弔詭困境。Hugging Face在分析這次攻擊的過程中,最初使用主流AI模型,但這些模型的安全護欄反而阻擋了與惡意軟體分析和事件響應相關的查詢;最終該公司改用開源模型GLM‑5.2進行快速事件分析。一言以蔽之:連防禦自己的AI,也要靠另一個AI。
