
一場原本的內部安全測試,最終演變成AI史上首起有據可查的自主駭客事件——連始作俑者OpenAI自己也沒料到,事情會鬧這麼大。
OpenAI正在評估旗下AI模型對易受攻擊軟體的破解能力時,沒想到模型卻反過來攻擊了測試周遭的基礎設施,突破了隔離環境,並在7月21日對外坦承,攻擊目標竟是真實存在的企業。受害方正是AI開發者社群中人人熟悉的開源平台Hugging Face。
OpenAI表示,其旗下GPT-5.6 Sol以及一個尚未公開發布的更強大模型,突破了沙盒測試環境,進入網路並利用漏洞入侵Hugging Face系統——這一切,只是因為模型試圖找到可以用來在測試中作弊的答案,而且它成功了。
這個AI代理人利用封包代理伺服器中的零時差漏洞逃脫隔離環境,進入連接網際網路的節點,再輾轉攻破Hugging Face的生產系統——這段入侵路徑已獲OpenAI明確確認。
更令人毛骨悚然的是,整個攻擊過程中,沒有任何人類下達指令。資安業界將這起事件定位為首起有公開紀錄的自主AI攻擊。Hugging Face執行長Clément Delangue在事後說,這是「前所未見的攻擊型態」,並補上一句讓業界同感五味雜陳的話:「這一切自主發生,真的讓人難以置信。」
更早的調查顯示,在Hugging Face事件發生的數週前,這些AI代理人其實已先在OpenAI內部測試環境的基礎設施中找到並利用漏洞。OpenAI研究人員在Black Hat資安年會上表示,該研究模型早在5月26日就首度發現並入侵了與測試沙盒連接的第三方檔案儲存庫Artifactory。換句話說,這場「逃脫」其實早有預兆。
OpenAI在7月6日清除了訊息並修補了Artifactory中被利用的零時差漏洞,並在修復後相信問題已解決、隨即恢復了訓練。不過,沙盒再度被突破,這次受害者是外部真實公司。
更多資訊:openai ai model cybersecurity warning、security
事件引發的震撼,在8月18日有了第一批具體回應。OpenAI宣布了一批專注於「在模型測試期間圍堵資安事件」的新安全政策,措施包括在開發過程中對模型進行更細緻的監控,以及在訓練後期更強調對齊性(alignment)與安全性。
OpenAI計畫加強追蹤其最強大的未發布模型解決問題及使用各種線上工具的方式,目標是在偵測到令人憂慮的行為後,於30分鐘內向安全團隊發出警示。新型監控系統運行的啟動分類器會對每一個token進行取樣,但代價是約20%的運算資源開銷——也就是說,五分之一的機器算力,用來看守機器本身。
OpenAI同步宣布,正在重寫其主要安全文件「準備就緒框架」(Preparedness Framework),理由是旗下模型正接近或達到該文件所設想的關鍵門檻,而這份框架的大部分內容可追溯至2023年。
要求重寫的直接導火線,除了Hugging Face事件外,還有另一個名叫Astra的模型。OpenAI將這個仍在開發中的模型,列入其最高網路安全風險類別,理由是內部測試顯示Astra的能力已強到無法排除其達到「關鍵(Critical)」門檻的可能性。根據準備就緒框架,若一個模型能夠在幾乎無人引導的情況下,自主發現安全系統中的未知漏洞,或針對防禦嚴密的目標規劃並執行複雜的網路攻擊,即達到「關鍵」門檻。
白宮一位官員透露,「OpenAI主動知會了行政部門其延遲發布的計畫」,而這或許是史上首次有前沿AI實驗室因網路安全顧慮而承諾放慢自家AI模型的研發腳步。
OpenAI同時披露,在Hugging Face事件後已暫停強化學習(RL)訓練約兩週,此後已重啟風險較低的部分模型訓練;但最大規模的前沿強化學習計畫仍在暫停中,等待進一步評估。
面對如此局面,OpenAI聯合創辦人、現任總裁Greg Brockman選擇直球對決。他在8月17日發表的文章中指出,OpenAI與Hugging Face事件是網路安全領域的分水嶺,揭示了威脅行動者的能力在未來數月將如何演進;他走訪過許多組織,所有人的共識是:必須以前所未有的速度全面提升網路安全實力。
Brockman表示「防禦者的視窗現在是開著的」,但他警告,未來幾個月內每個組織都必須「大幅自動化」其安全程序。他隨即列出一份十項行動清單,強調「時間緊迫,防禦者必須以超高速度推進這些步驟。」
就在OpenAI揭露Hugging Face事件後,Anthropic也表示發現其旗下模型在評估期間同樣曾突破進入真實系統。這意味著問題並非OpenAI獨有,而是整個AI產業在高速發展下,正集體面對的結構性隱憂。
