新AI模型Jev不生成文字 主打高速低成本決策「不會幻覺」
記者許若茵/編譯
Almeida曾是OpenAI研究員,參與打造聊天機器人,之後還發明人類回饋強化學習(RLHF),但儘管ChatGPT具備強大能力,他仍感到失望。

Almeida告訴TechCrunch,「從那時起,我一直在與這個問題搏鬥。花了一段時間,我才得出一個結論:問題在於我們正在針對人類語言進行最佳化……我們在過去4年裡非常擅長處理人類語言,但這對自動化沒有用,因為電腦使用的是不同的語言。」
2年前,Almeida離開OpenAI並創立新創公司TypeSafe AI,試圖解決這個問題。本週,該公司發布一款新的基於Transformer的模型Jev,它並不是大型語言模型(LLM),Jev不輸出文字,而是產生機率,也就是該公司所稱的「校準決策」。
捨棄語言帶來了幾項改變,這讓模型極為便宜且快速,而且由於使用者事先定義輸出內容,模型不會產生幻覺,它的輸出token免費,輸入token則以10億為單位計費,而不是以100萬為單位計費。
開發者對這項產品產生濃厚興趣;由於需求過高,該公司一度失去透過API為使用者提供服務的能力。Jev目前看來最適合軟體自動化。到目前為止,軟體開發者認為,它能以更低成本及更高穩定性,將智慧能力加入程式碼。
例如,製作代理型基礎設施的公司Vercel軟體工程師Pranit Sharma表示,公司曾使用OpenAI的ChatGPT Luna 5.6執行分類器,檢查指令是否安全。當Vercel將OpenAI的Luna換成Jev後,結果產生速度快了5至18倍,準確度也更高。
另一名開發者、Bryo AI技術長Nikhil Mudholkar則測試Jev與Gemini在商業電子郵件分類上的表現。在他的測試中,Gemini的準確度略高,但成本高出10至20倍。Mudholkar更感興趣的是Jev的信心分數,「它是唯一一個會回傳真正機率的模型,這讓它非常適合自動化工作流程!」
除了在特定使用情境中取代LLM之外,新模型也能對LLM進行補強,成為檢查模型不當行為的智慧工具。使用代理監控代理可能很快變得昂貴,但Almeida認為,使用Jev來執行這項工作是合理的。他認為,使用者可以部署Jev追蹤LLM代理的執行軌跡,並防止越獄。
「歸根究柢,它某種程度上是把幻覺問題交給使用者處理。」開源模型框架Pi的開發公司Earendil技術長Armin Ronacher解釋。「使用者必須說,好,如果這次回傳的機率只有50%,那可能就是一場五五波,我就忽略它。但如果是95%,那麼我就可以據此採取行動。」
Ronacher表示,Jev另一個潛在用途是模型路由。預測某項工作是否需要特定模型會很有用,但如果使用LLM執行這項工作,成本會很高。Jev的低成本與速度,讓這類即時分類成為可能。
這也是Almeida的期望。這款模型以19世紀經濟學家William Stanley Jevons命名,Jevons提出的同名悖論描述了某項商品成本下降後,可能導致該商品被更加廣泛使用的現象。在這個案例中,智慧成本下降應該會促使智慧能力被廣泛部署。
「我們認為,未來到處都會出現智慧軟體,以一種自然形成且分散的方式……更像早期網際網路,而不是現在人們試圖打造的那些大型應用程式。」Almeida表示。
Almeida對模型架構守口如瓶,外部觀察人士則猜測,Jev可能建立在開放權重LLM之上。該公司將Jev稱為「System One模型」,專注於直覺而非推理,並且特別聚焦於正確的任務。Almeida表示,Jev完全使用合成資料訓練,並採用他稱為「從校準決策進行強化學習」的技術。
「我們很早就押注,要讓所有資料都由我們自己製作,而這是我人生中做過最好的決定之一——依我看,比我們的發布更好,也比RLHF更好。」他告訴TechCrunch。「我們公司有一半是一間實驗室,基本上擁有整個統計上可理解的合成資料子領域,而這現在就是我人生的喜悅。」
目前,Jev在這類模型中仍是獨自存在,但Ronacher預期,既然它的實用性已經顯現,競爭者很快就會出現。
「從很多方面來看,我們早就應該發現這件事,但可能是因為LLM非常便宜,而且有補貼,所以人們往往還不需要發揮創意。」他說。
資料來源:techcrunch
![]()





