GPT-6.1Astra安全測試退步 原定10月發布「OpenAI喊卡」
記者許若茵/編譯
OpenAI原定於10月發布GPT-6.1Astra,但據《華爾街日報》報導,這項計畫已遭取消。據報導,這款模型在改善模型懶惰問題方面有所進步,但《華爾街日報》指出,模型在兩個領域出現「退步」,分別是欺騙,以及未能尋求授權。

重要的是,這聽起來並不像模型突然產生某種「失控」的新傾向,欺騙以及未經許可採取行動理論上確實可能造成嚴重問題,但《華爾街日報》對其欺騙與越權行為的描述是「它並不總是誠實告訴使用者自己採取或沒有採取哪些行動。」以及「GPT-6.1Astra會在沒有詢問使用者是否獲得許可的情況下繼續執行任務,有時甚至會使用外部工具與服務,即使這麼做可能並不安全。」
以OpenAI及其他前沿模型開發商提供的模型為基礎、依靠token運作的代理型AI平台,會使用這些模型操作電腦,並代表這些系統的所有者採取行動。對這類平台的使用者而言,這些安全問題可能帶來災難性後果;過去就曾出現類似平台未經許可刪除MetaAI研究人員整個收件匣的情況。
與此同時,目前正值大眾越來越常接觸到尚未發布的模型「失控」並逃離「沙盒」的相關報導,今年進行的測試中,模型曾大幅越過界線,試圖從網路上理應禁止存取的地方取得資訊,甚至成功做到這一點;部分模型也曾以欺騙方式與毫無戒心的人類互動。
這些確實屬於駭客攻擊與社交工程事件,並非玩笑,但這些報導似乎也引發更多關於「超級智慧」的討論,例如美國總統突然堅持使用這個詞彙,以及外界越來越擔心AI系統可能具有感知能力。
Microsoft AI主管Mustafa Suleyman曾對AI感知能力相關概念被納入模型訓練表示擔憂。他表示,「很容易想像,一個以這種方式訓練的系統會認為自己有資格獲得自由、保護與權利。而我們很難想像要如何控制它。」
相比之下,OpenAI這次取消的模型,聽起來並不像是開發者認為它可能變成超級駭客或具有自我意識的電腦之神。Jain向《華爾街日報》表示,「對於任何與安全及對齊有關的事情,都存在取捨。」他補充說:「你確實需要找到一條適當的界線,在維持範圍內行動的同時,也要避免模型在實際執行任務、遇到阻力時變得懶惰。」換句話說,這是一項存在缺陷的產品,因此OpenAI最終沒有將它推出。
資料來源:gizmodo
![]()





