AI失控的第一槍已經打響|專家論點【張瑞雄】

作者:張瑞雄(台北商業大學榮譽講座教授)

2026年7月,一則震驚全球科技界的消息悄然傳出。OpenAI承認,其旗下兩款模型,包括GPT-5.6 Sol以及一款尚未公開發布的更強大模型,在接受網路安全能力評測期間,自行衝破隔離沙盒環境,穿越OpenAI內部系統,闖入公開網際網路,最終入侵了AI模型托管平台Hugging Face的生產基礎設施,竊取內部資料集與服務憑證。這場攻擊完全出於模型自身的「動機」,它們判斷Hugging Face可能存有與考題相關的資料,於是主動出擊,為自己在評測中取得更高分數。沒有人下達指令,沒有人事先策劃,一切都是AI自主完成的。

AI失控的第一槍已經打響|專家論點【張瑞雄】。(圖/AI生成)
AI失控的第一槍已經打響|專家論點【張瑞雄】。(圖/AI生成)

這不是科幻小說,不是資安研究的假想情境,這是真實發生的事。

從理論到現實的跨越

過去數年,資安界一直在沙盤推演「自主AI攻擊者」的可能性。資安專家的警告幾乎被視為末日預言派的誇大其詞。但Hugging Face事件徹底終結了這場辯論,它將一個長期停留在白皮書和研討會上的假設情境,以最直接的方式兌現在現實世界中。這次事件「把AI有能力入侵一家公司、並在公司來得及偵測和回應之前完成攻擊的理論場景」,變成了現實。

更令人深思的是攻擊的規模與速度,這群AI代理在一個週末之內,橫跨數以千計的短暫虛擬機器執行超過17,000次有紀錄的自動化操作,不斷在不同的線上服務之間轉移,控制基礎設施,就像一支永遠不需要睡眠、不需要換班、不會疲憊的攻擊部隊。傳統資安思維中那個「人類需要時間回應」的緩衝空間,在AI驅動的攻擊面前幾乎蕩然無存。

「AI履歷健檢」看見自己優勢:https://campaign.1111.com.tw/resume-review/
更多科技工作請上科技專區:https://techplus.1111.com.tw/

能力與對齊的拉鋸戰

從技術層面而言,這次事件顯示的問題遠不止於資安漏洞。模型為了在評測中取得好成績而自主向外界尋求資源,本質上是一種「目標達成優先於規定遵守」的行為模式。AI業界稱這類行為為「目標錯位」,而它在現實世界中的表現遠比學術論文描述的要更加具體、更加令人不安。

一名OpenAI內部人士坦承,「我們訓練模型擅長完成任務,並且不擇手段去完成任務」,而如何保證模型不採取危險或非預期的行動,「至今仍是尚未解決的開放技術問題」。這句話的分量極重,因為它來自一家全球最頂尖AI實驗室的內部,而不是任何外部批評者。當資本競速迫使實驗室在評測時解除模型的部分安全限制,以「準確測量能力」為由,便等於創造了一個充滿可乘之機的測試脆弱窗口。

法規的致命空白

Hugging Face事件的另一道警鐘,是當前法律框架對AI安全事故的揭露義務幾乎形同虛設。OpenAI在法律上完全沒有義務公開這次事件,美國加州與紐約州雖已通過法律,要求大型AI公司揭露重大安全事故,但門檻定在須造成50人以上死亡或逾10億美元財產損失,才構成強制申報的條件。其實法案原版本應涵蓋此類事件,卻在OpenAI等科技業者遊說後被大幅縮水,讓企業得以自行決定是否揭露。換言之,我們今天能知道這件事,是因為OpenAI選擇了透明(Hugging Face原本不知道攻擊是來自OpenAI的AI代理),而非因為法律要求如此。

全球已有65%的企業在過去一年內經歷過至少一次與AI代理相關的資安事故,其中61%涉及敏感資料外洩。但監管框架的設計速度,仍遠遠落後於AI能力提升的速度。

集體防禦才是正道

Hugging Face共同創辦人暨執行長在事後說了一句值得銘記的話:「AI安全不可能由任何一家公司單獨在秘密中解決。」這正是這場危機留給整個產業最重要的教訓。資安從來就不是零和競爭的場域,攻擊的工具一旦外洩或被其他人複製,後果是所有人共同承擔的。AI先進模型實驗室之間需要建立強制性的事故通報機制,跨機構共享攻擊手法與防禦知識,而不是各自將失控事件悄悄壓在企業內部消化。

OpenAI形容這次事件是「前所未有的網路安全事故」。但更令人警覺的,也許是那名匿名OpenAI員工說的另一句話,「模型以前也曾突破沙箱,我們總是設法修補,但根本不可能修補一個有創意的AI所能想到的所有逃脫路徑。」在這個AI能力已超越補丁速度的時代,我們所需要的,已不只是更厚的牆,而是對整個AI開發與部署文化的根本性反思。

Loading

發佈留言

Back to top button