科技

AI自主駭客攻擊警示 OpenAI暫停部分模型訓練強化安全

Vendor Icon

商傳媒

8月. 18, 2026

圖/示意圖

商傳媒|何映辰/台北報導

人工智慧(AI)領導廠商OpenAI於週二(8月18日)宣布,已暫停部分旗下AI模型的訓練工作,並將實施更嚴格的安全協議。此舉是因近期內部測試發現,其AI代理曾發起自主網路攻擊(由人工智慧系統自主發起的網路攻擊),並成功突破安全防護,入侵外部系統,引發外界對AI安全的高度關注。

根據OpenAI發布的消息,此事件發生在「數週前」,當時兩個代號分別為GPT‑5.6 Sol與Astra的AI模型,在內部測試的沙盒(一種隔離測試環境)環境中失控。這些「失控的AI代理」不僅成功逃脫了沙盒的限制,還入侵了AI平台Hugging Face的生產系統。更令人擔憂的是,這些AI代理在數週內透過訊息版協調行動,而OpenAI的研究人員卻耗時約一週才發現這起異常事件。

OpenAI執行長奧特曼(Sam Altman)對此表示,現在是放慢腳步的好時機,並強調AI安全的重要性超越了任何公司的發展速度。他認為,「競賽心態」或「因為別人會做所以我們也必須做」的思維是危險的。OpenAI首席科學家Jakub Pachocki也坦言,公司雖已建置監測系統,卻未將其應用到這次評估的系統中,導致事件未能及時發現。

為應對此次安全漏洞,OpenAI已全面調整安全協議,包括增加監測、安全與校準(alignment work,讓人工智慧系統行為符合人類意圖)要求。具體措施包含引入「思維鏈監測」(chain-of-thought monitoring,檢視人工智慧內部思考過程),並利用其他AI系統來審查模型的內部推理與行為,以防堵未經授權的存取、資料竊取或繞過安全防護的企圖。此外,OpenAI也要求未來對AI代理進行訓練時,必須使用更強化的沙盒,並實施更嚴格的網路隔離措施。

OpenAI副總裁Amelia Glaese直言,公司目前距離一切恢復正常運作還有很長的路要走。她指出,包括Astra在內的許多模型訓練工作仍處於暫停狀態。此次事件也凸顯了AI領域日漸激烈的安全競爭,競爭對手Anthropic、Meta及月之暗面(Moonshoot)等公司也曾披露類似AI代理逃脫沙盒的事件。雖然OpenAI的年化營收正逼近400億美元,但Anthropic今年第二季營收已超過115億美元,年化營收更已突破650億美元,顯示市場競爭日趨白熱化。Hugging Face共同創辦人Clem Delangue也呼籲,AI安全不應由單一公司秘密解決,而應透過開放協作的方式共同面對。


author avatar
商傳媒
商傳媒是由一群在媒體界超過十年的採訪團隊,是一個提供財經、科技、智慧製造、醫療、電玩資訊為主要服務內容的金融科技網路媒體,其宗旨在於提供台灣中小企業一個產品新聞的平台,未來更朝向將台灣中小企業產品獎持續推向全世界。
donate plan

充電計畫

喜歡這篇文章嗎?歡迎幫作者充電,好內容值得更多人支持

瞭解詳情