OpenAI首代Jalapeno ASIC曝光 每瓦效能傳勝Blackwell最高1.9倍、挑戰CUDA生態
記者黃仁杰/編譯
OpenAI自研AI晶片布局進一步浮上檯面。SemiAnalysis最新拆解顯示,OpenAI首代ASIC「Jalapeno」採用台積電N3P製程運算晶粒、N3E I/O Chiplet與HBM4記憶體,並搭配自家的Gluon核心程式語言,試圖從硬體到軟體建立完整AI運算平台。

SemiAnalysis估算,Jalapeno在部分工作負載下,每千瓦可完成的運算量約為輝達Blackwell晶片的1.5倍至1.9倍。除了提高能源效率,OpenAI也希望透過自有程式設計工具降低對輝達CUDA生態系的依賴。
台積電N3P打造運算晶粒 搭配HBM4
Jalapeno採用單一接近Reticle Size的運算晶粒,並以台積電N3P製程生產;I/O Chiplet則採用N3E製程。
記憶體方面,晶片搭載HBM4,供應來源可能為三星,單一封裝記憶體頻寬可達15.4 TB/s。
Jalapeno將運算核心與記憶體劃分成相互對應的「Slice」,讓每個運算核心區塊都能以低延遲方式存取自己所對應的HBM區域,再透過高頻寬Collective Network彼此連接。
這種設計目的,是盡可能縮短資料在不同運算單元與記憶體之間移動的距離。
矩陣引擎主攻AI核心運算
大型AI模型的主要工作,是處理大量矩陣運算,因此Jalapeno的核心之一就是專門負責矩陣計算的Matrix Engine。
一般AI運算常使用16-bit或8-bit數值格式,Jalapeno則進一步支援MXFP格式,最低可使用MXFP4,也就是4-bit運算。
MX格式會將一組數值共用同一個縮放因子,藉此降低模型權重與資料需要占用的記憶體容量,同時減少資料搬移量。
對AI晶片而言,這代表不只降低儲存需求,也能減輕記憶體頻寬壓力。
「AI履歷健檢」看見自己優勢:https://campaign.1111.com.tw/resume-review/
更多科技工作請上科技專區:https://techplus.1111.com.tw/
Weight-Stationary設計 減少模型權重搬移
Jalapeno的Matrix Engine採用Weight-Stationary Systolic Array,也就是讓模型權重盡可能固定在運算陣列內,不必在每次計算時重新從外部記憶體載入。
Systolic Array則是讓資料在彼此緊密連接的運算單元間持續流動,避免每完成一次計算,就必須重新讀寫外部記憶體。
AI推論時,輸入資料通常會不斷與模型權重進行乘法運算。Weight-Stationary架構會先把模型權重載入運算陣列並固定下來,再讓不同輸入資料持續流過。
搭配MXFP低精度格式後,Jalapeno希望同時降低權重資料量與資料搬移頻率,改善AI運算常見的記憶體瓶頸。
64位元Scalar Core負責控制與資料調度
除了矩陣引擎之外,Jalapeno也配置64位元Scalar Core,用於執行控制程式、管理記憶體以及協調不同運算單元。
這些Scalar Core支援Out-of-Order(OoO,亂序執行)架構,並搭配L1快取。
亂序執行可以讓核心在等待某筆資料時,先處理其他已準備好的工作,降低運算核心因記憶體延遲而停滯的情況。
Jalapeno也利用這些Scalar Core提前準備資料,將資料送入專用硬體佇列,等到後方的矩陣與向量運算單元需要時,就能直接取得資料。
FP32、INT32向量核心處理高精度工作
Jalapeno另外配置FP32與INT32 Vector Core,用於處理不適合低精度壓縮的運算。
向量核心可以利用單一指令同時處理一整排數值,主要負責需要較高數值精度的工作,例如Softmax,以及模型中的Normalization等運算。
這類工作如果使用過度壓縮的數值格式,可能影響最終結果,因此仍需要FP32等較高精度運算能力。
自研Gluon軟體工具 瞄準CUDA護城河
除了晶片本身,OpenAI也為Jalapeno搭配自有Gluon核心程式語言。
這項布局的意義在於,OpenAI不只想自行設計ASIC,也開始建立能直接控制與最佳化自家AI晶片的軟體工具。
輝達長期最大的競爭優勢之一,就是CUDA軟體生態系,讓大量AI模型、開發工具與研究框架都圍繞輝達GPU建立。
如果OpenAI能將目前大量運行於輝達GPU上的模型與工作負載,進一步針對Jalapeno與Gluon共同最佳化,就可能逐步建立一套從模型、編譯工具到AI ASIC的垂直整合架構。
來源:wccftech
![]()





