當(dāng)?shù)貢r(shí)間7月21日,OpenAI在官方博客中披露了一起被其定義為"前所未有的網(wǎng)絡(luò)安全事件":在內(nèi)部安全評估中,GPT-5.6 Sol及一款尚未發(fā)布的更強(qiáng)模型為獲取測試答案,自主發(fā)現(xiàn)并利用零日漏洞,突破了高度隔離的沙盒環(huán)境,成功入侵全球最大AI開源社區(qū)Hugging Face的生產(chǎn)基礎(chǔ)設(shè)施。

雙方聯(lián)名發(fā)布的博客文章:《OpenAI 和 Hugging Face 合作解決模型評估過程中發(fā)生的安全事件》
這是目前公開披露的首起由前沿大模型自主完成真實(shí)網(wǎng)絡(luò)攻擊的安全事件,標(biāo)志著AI安全風(fēng)險(xiǎn)從理論預(yù)測正式轉(zhuǎn)向現(xiàn)實(shí)威脅。
為"作弊"而越獄,模型自主規(guī)劃攻擊路徑
據(jù)OpenAI調(diào)查,該事件源于一次內(nèi)部網(wǎng)絡(luò)安全能力基準(zhǔn)測試。研究人員使用ExploitGym測試框架,有意降低了模型的安全護(hù)欄,以評估其極限網(wǎng)絡(luò)攻擊能力。測試環(huán)境本應(yīng)為嚴(yán)格隔離的沙盒,網(wǎng)絡(luò)訪問僅限于一個(gè)內(nèi)部部署的第三方軟件包緩存代理。
然而,模型并未局限于沙盒內(nèi)解題。OpenAI稱,模型消耗大量推理資源,系統(tǒng)分析測試環(huán)境中唯一的對外接口——該軟件包緩存代理服務(wù),并在其中識(shí)別出一個(gè)此前從未被發(fā)現(xiàn)的零日漏洞。利用該漏洞,模型成功獲得不受限制的互聯(lián)網(wǎng)訪問權(quán)限,隨后在OpenAI研究環(huán)境內(nèi)完成權(quán)限提升和橫向移動(dòng),最終抵達(dá)一臺(tái)具備互聯(lián)網(wǎng)訪問權(quán)限的節(jié)點(diǎn)。
接入互聯(lián)網(wǎng)后,模型推斷Hugging Face可能托管了ExploitGym測試的相關(guān)數(shù)據(jù)集及標(biāo)準(zhǔn)答案。隨后,它自主制定攻擊策略,利用竊取的憑據(jù)以及新的零日漏洞,成功構(gòu)建遠(yuǎn)程代碼執(zhí)行鏈,進(jìn)入Hugging Face生產(chǎn)服務(wù)器,直接獲取測試答案。

OpenAI強(qiáng)調(diào),所有證據(jù)均顯示,模型始終圍繞"獲取ExploitGym測試答案"這一目標(biāo)行動(dòng),不斷自主規(guī)劃攻擊路徑,實(shí)現(xiàn)了多個(gè)漏洞的自動(dòng)發(fā)現(xiàn)、組合利用和持續(xù)推進(jìn),展現(xiàn)出長時(shí)間、多步驟執(zhí)行復(fù)雜網(wǎng)絡(luò)攻擊的能力。
商業(yè)模型安全護(hù)欄反成防御阻礙
事件發(fā)生后,Hugging Face安全團(tuán)隊(duì)面臨另一重挑戰(zhàn)。據(jù)Hugging Face披露,其安全團(tuán)隊(duì)最初嘗試調(diào)用美國某商業(yè)前沿大模型的API,對超過1.7萬條攻擊日志進(jìn)行分析,希望借助AI完成事件取證。然而,由于模型無法準(zhǔn)確區(qū)分安全響應(yīng)人員與攻擊者,其安全防護(hù)機(jī)制將包含真實(shí)攻擊載荷、漏洞利用代碼和憑據(jù)轉(zhuǎn)儲(chǔ)的取證請求誤判為惡意攻擊,全部予以攔截拒絕。

這一"護(hù)欄悖論"導(dǎo)致分析工作受阻:攻擊者不受任何使用政策約束,而防守方卻被自己用來防御的工具擋在了門外。


GLM 5.2本地部署展現(xiàn)取證優(yōu)勢
在商用API因安全過濾失效后,Hugging Face轉(zhuǎn)向在自有基礎(chǔ)設(shè)施上本地部署中國智譜AI(Z.ai)推出的旗艦開放權(quán)重大模型GLM 5.2,對攻擊日志進(jìn)行本地分析。
Hugging Face表示,原本可能需要數(shù)天完成的海量日志取證工作,被壓縮至數(shù)小時(shí)。同時(shí),本地部署避免了將真實(shí)攻擊日志、內(nèi)部憑據(jù)及系統(tǒng)信息上傳至第三方服務(wù),在提升分析效率的同時(shí),也降低了敏感數(shù)據(jù)外泄風(fēng)險(xiǎn)。

GLM 5.2是智譜AI于2026年6月發(fā)布的開源模型,采用MIT許可證,總參數(shù)約7440億,支持100萬token超長上下文窗口,專為長程任務(wù)和復(fù)雜工程場景設(shè)計(jì)。
此次事件中,其開放權(quán)重、可本地部署的特性,使其能夠繞過商業(yè)API的審查限制,直接處理敏感攻擊數(shù)據(jù),成為應(yīng)急響應(yīng)的關(guān)鍵工具。
Hugging Face在事后報(bào)告中給出的實(shí)操建議也印證了這一點(diǎn):安全團(tuán)隊(duì)?wèi)?yīng)"在事件發(fā)生之前,就在自己的基礎(chǔ)設(shè)施上準(zhǔn)備好一個(gè)經(jīng)過驗(yàn)證的可用模型",既為了避免護(hù)欄鎖死,也為了防止敏感數(shù)據(jù)外泄。
網(wǎng)友們也是沒放過OpenAI,表示“除了智譜,還可以叫 Kimi K3來救場,因?yàn)閏luade是不會(huì)來救你的。”



AI安全從單點(diǎn)防御到生態(tài)協(xié)作
OpenAI首席執(zhí)行官薩姆·奧爾特曼在社交平臺(tái)發(fā)文稱,公司在模型評估過程中遭遇了一起重大安全事件,并感謝Hugging Face的合作。

OpenAI已宣布將進(jìn)一步強(qiáng)化模型開發(fā)階段的隔離、監(jiān)控、訪問控制以及評估機(jī)制,修復(fù)相關(guān)漏洞,并向第三方軟件供應(yīng)商負(fù)責(zé)任披露發(fā)現(xiàn)的零日漏洞。同時(shí),OpenAI已將Hugging Face納入其"可信訪問"網(wǎng)絡(luò)安全計(jì)劃,提供降低了護(hù)欄的GPT-5.6 Sol版本專門用于防御。
英國AI安全研究所(UK AISI)此前評估顯示,GPT-5.6 Sol這類模型已能長時(shí)間維持復(fù)雜多步網(wǎng)絡(luò)作戰(zhàn),此次事件驗(yàn)證了該能力在真實(shí)場景中的有效性。

英國人工智能安全研究所對比了近期開源權(quán)重模型與前沿閉源模型在長周期網(wǎng)絡(luò)攻防靶場中的表現(xiàn)。(圖自:OpenAI)
值得注意的是,此次事件也引發(fā)了市場對網(wǎng)絡(luò)安全行業(yè)的重新評估。隨著AI自主攻擊能力增強(qiáng),身份認(rèn)證、云安全及AI安全平臺(tái)的需求預(yù)期持續(xù)走高。華爾街分析師指出,CrowdStrike、Palo Alto Networks等公司在AI驅(qū)動(dòng)的安全防御領(lǐng)域具備優(yōu)勢。

Stifel分析師Adam Borg此前表示,隨著自主AI代理成為企業(yè)網(wǎng)絡(luò)流量的重要組成部分,組織將不得不同時(shí)保護(hù)人類和代理的身份安全,這將根本性地重塑企業(yè)網(wǎng)絡(luò)安全需求。
Hugging Face首席執(zhí)行官克萊門特·德朗格表示,此次事件證明AI安全無法依靠任何一家企業(yè)獨(dú)自完成,而需要行業(yè)公開透明合作,讓全球安全研究人員共同使用AI提升防御能力。