搜尋

會員登入

搜尋

導覽

會員

OpenAI自研ASIC攻推論 AI晶片進入Token效能戰

瀏覽次數:541

生成式AI競爭正由模型參數與訓練算力,進一步轉向「推論經濟學」。OpenAI公布首款自研推論ASIC「Jalapeno」實測結果,透過晶片、HBM、網路與Serving軟體協同設計,試圖同時突破高吞吐量與低延遲難以兼得的限制,核心指標也由傳統FLOPS轉向每瓦可處理AI工作量、Token延遲與整體服務成本。


Jalapeno由OpenAI與博通共同開發,定位並非通用GPU,而是針對大型語言模型推論最佳化的ASIC。架構採用HBM4,並強調降低資料搬移與晶片間通訊開銷,讓KV Cache等模型狀態盡可能保留於本地記憶體,再依Prefill與Decode等不同推論階段調度運算、記憶體及網路資源。



圖一 : OpenAI自研ASIC挑戰GPU  AI推論進入Token成本與客製晶片戰。
圖一 : OpenAI自研ASIC挑戰GPU AI推論進入Token成本與客製晶片戰。

根據OpenAI使用InferenceX進行的測試,Jalapeno在GPT-OSS 120B、DeepSeek R1 670B及Kimi K2.5 1T三種模型上,峰值吞吐量條件下每瓦AI工作量較比較系統提高約1.5至1.9倍,端到端延遲降低1.7至3.6倍;高度互動工作負載效能則提高2.1至4.1倍。
...
...

使用者別 新聞閱讀限制 文章閱讀限制 出版品優惠
一般使用者 10則/每30天 0則/每30天 付費下載
VIP會員 無限制 25則/每30天 付費下載

Card Image

Smart Energy:數位電錶除了量測電壓和電流外,還需要什麼強大的功能?

Microchip 推出的全新加強型智能電錶解決方案,擁有複雜且精準的計量韌體,並支持基礎的電錶應用。此方案在數位電錶數據傳輸方面,既可以通過電力線傳輸,也可以使用藍牙…

Microchip 推出的全新加強型智能電錶解決方案,擁有複雜且精準的計量韌體…