生成式AI競爭正由模型參數與訓練算力,進一步轉向「推論經濟學」。OpenAI公布首款自研推論ASIC「Jalapeno」實測結果,透過晶片、HBM、網路與Serving軟體協同設計,試圖同時突破高吞吐量與低延遲難以兼得的限制,核心指標也由傳統FLOPS轉向每瓦可處理AI工作量、Token延遲與整體服務成本。
Jalapeno由OpenAI與博通共同開發,定位並非通用GPU,而是針對大型語言模型推論最佳化的ASIC。架構採用HBM4,並強調降低資料搬移與晶片間通訊開銷,讓KV Cache等模型狀態盡可能保留於本地記憶體,再依Prefill與Decode等不同推論階段調度運算、記憶體及網路資源。
|
根據OpenAI使用InferenceX進行的測試,Jalapeno在GPT-OSS 120B、DeepSeek R1 670B及Kimi K2.5 1T三種模型上,峰值吞吐量條件下每瓦AI工作量較比較系統提高約1.5至1.9倍,端到端延遲降低1.7至3.6倍;高度互動工作負載效能則提高2.1至4.1倍。
...
...
| 使用者別 | 新聞閱讀限制 | 文章閱讀限制 | 出版品優惠 |
| 一般使用者 | 10則/每30天 | 0則/每30天 | 付費下載 |
| VIP會員 | 無限制 | 25則/每30天 | 付費下載 |

