OpenAI Jalapeño ASIC:架构、性能与权衡
OpenAI 与 Broadcom 合作,推出了其首款定制 AI 推理 ASIC——Jalapeño。据报道,该芯片从设计到 tape-out 仅用了约 16 个月。Jalapeño 并非单纯追求峰值 FLOPS,而是围绕一个更贴近生产实际的指标进行设计:每兆瓦 Tokens(tok/s/MW),或等价于单位能量下的 token 吞吐量。
这一设计目标几乎决定了所有主要架构决策。Jalapeño 降低了对传统 GPU 抽象的依赖,将计算与内存紧密耦合,采用更小的脉动阵列以更高效地处理不规则工作负载,并将 prefill 与 decode 工作负载统一在同一硬件资源池中。
最终结果是一款主要为数据中心严格功耗约束下的高吞吐量推理而优化的加速器,而非通用训练架构。
🚀 关键硬件规格 #
| 指标 | OpenAI Jalapeño (A0/B0) | NVIDIA GB200 (Blackwell) | NVIDIA Vera Rubin (VR200) |
|---|---|---|---|
| 主要工作负载 | 通用 AI 推理 | 训练与推理 | 训练与推理 |
| 工艺节点 | TSMC N3P | TSMC N4P | TSMC N3P |
| TDP | 700 W | 1,000–1,200 W | 每 die 900–1,150 W |
| MXFP4 / NVFP4 算力 | 13.4 PFLOPS | ~10 PFLOPS | 17.5 PFLOPS |
| FP8 算力 | 3.4 PFLOPS | ~5 PFLOPS | ~8.7 PFLOPS |
| FP16 | 不支持 | 1,250 TFLOPS | 支持 |
| 内存 | 216 GiB HBM4 | 192 GB HBM3e | HBM4 |
| 内存带宽 | 15.4 TB/s | 8.0 TB/s | ~13–15 TB/s |
| 每瓦 HBM 带宽 | ~22 GB/s/W | 较低 | 中等 |
规格特征清晰地体现了 Jalapeño 的设计目标。它并不试图在所有计算指标上占据主导,而是将大量硅片面积和功耗预算分配给内存带宽与推理效率——在生产级 LLM 服务中,数据搬运往往成为真正的瓶颈。
其 700 W 的功耗包络在机架级部署时尤为重要。同时,216 GiB 的 HBM4 与约 15.4 TB/s 的带宽,为那些常受内存流量而非算术吞吐量限制的工作负载提供了充足的本地内存子系统。
🧠 四大架构权衡 #
Jalapeño 偏离了多项传统 GPU 设计假设。共同主题是消除那些在推理工作负载走向小 batch、可变序列长度以及高并发服务时,变得越来越昂贵的固定开销。
切片式内存与直连 NoC #
计算阵列与 HBM 被划分为 64 个匹配的切片,在计算资源与内存之间建立了局部对应关系。
每个计算切片都能以低延迟访问其对应的 HBM 切片,同时由专用的 Collective Network 负责切片间的同步与通信。
这种组织方式减少了将加速器视为单一整体内存系统的需求。架构直接在硬件与网络拓扑中暴露局部性,使工作负载能够利用可预测的计算-内存路径。
乱序核心与 L1 缓存 #
Jalapeño 采用乱序(OoO)核心与 L1 缓存,而非主要依赖软件管理的 scratchpad 和显式 DMA 引擎。
这一选择对推理尤为关键。软件管理的数据搬运会引入同步屏障,并暴露在小 batch 下难以隐藏的延迟。乱序执行提供了额外的调度灵活性,使硬件能够重叠操作并保持利用率,而无需软件显式编排每一个依赖关系。
目标是在不那么规则的生产工作负载上保持 roofline 效率,而不仅仅是在理想的大 batch 条件下最大化吞吐量。
更小维度的脉动阵列 #
Jalapeño 还缩小了其权重固定(weight-stationary)脉动阵列的矩阵维度。
大型固定矩阵引擎在张量维度与其偏好的 tile 尺寸匹配时能提供出色的利用率。然而,不规则维度会带来填充、低效分块以及突然的利用率下降。
更小的脉动阵列降低了这些性能悬崖。代价是加速器牺牲了部分峰值矩阵吞吐量,以换取在真实推理工作负载中遇到的各种形状上更一致的利用率。
统一资源池而非 Prefill-Decode 分离 #
Jalapeño 并未为 prefill 与 decode 采用专用硬件资源池(即通常所说的 Prefill-Decode Disaggregation,PDD)。
相反,它使用统一的加速器资源池,能够动态吸收不断变化的生产流量。这一点很重要,因为推理工作负载很少保持稳定的 prefill 与 decode 需求比例。上下文长度、并发度以及请求构成会持续变化。
统一资源池避免了将硬件静态分配给某一阶段,也消除了跨网络边界迁移 KV 缓存的需求。这可以降低通信开销与能耗,但同时也对调度器与运行时提出了更高要求。
💻 协同设计的软件栈:Gluon 与 Codex #
仅有硬件效率对定制加速器是不够的。因此 Jalapeño 配备了围绕其架构设计的软件栈,而非将其视为可直接替换的 GPU。
Gluon 领域特定语言 #
Gluon 是构建于 Triton 之上的领域特定语言。其核心抽象是 Linear Layouts,利用在 (\mathbb{F}_2) 上的二元矩阵代数来形式化表示张量、寄存器与内存之间的映射。
这种方法旨在使张量布局变换更易于处理。编译器可以通过代数方式推理变换,而不是依赖大量手动指定布局的组合,从而降低将张量映射到底层硬件时的组合复杂度。
对于定制加速器而言,这种控制力很重要,因为传统编译器抽象可能无法暴露足够信息,以高效利用专用的内存与计算布局。
Codex 驱动的内核生成 #
OpenAI 还使用内部 基于 Codex 的系统 来生成优化的内核与预取策略。
该系统并非完全依赖手写内核或传统通用编译器流水线,而是通过详细的 trace harness 评估生成实现在实际执行行为上的表现。
这在软件生成与硬件性能之间建立了更紧密的反馈循环。内核实现可以根据观察到的瓶颈进行优化,而不是仅依赖静态编译器启发式。
快速性能迭代 #
软硬件协同设计方法据报道在开发过程中实现了显著的性能提升。工程团队能够在两周内将吞吐量翻倍,并在约八天内将张量并行从 TP8 扩展到机架级 TP32。
对于定制推理 ASIC 而言,这种迭代速度具有战略重要性。硬件在 tape-out 后基本固定,剩余的性能空间主要来自编译器、内核、调度与网络方面的改进。
🏗️ 机架系统与网络拓扑 #
Jalapeño 被设计为完整机架级系统的一部分,而非孤立的加速器。
机架组成 #
系统由三类主要托盘组成:
- Katsu Host Tray: 双 AMD EPYC Turin CPU,配备 1.5 TB DRAM。
- Vindaloo ASIC Tray: 1U 机箱,包含八颗 Jalapeño ASIC,使每个机柜总计达到 128 个 XPU。
- Chana Switch Tray: 基于 Broadcom Tomahawk 6 交换机,交换容量达 102.4 Tb/s。
该架构将计算、主机处理与网络视为一个协同设计的整体系统。
两级 Scale-Up 网络 #
Scale-up 网络划分为本地域与全局域。
本地域通过全互连拓扑连接 128 个 XPU,使用 6,144 对差分对的无源铜背板。每个 XPU 在本地域内拥有高达 4.8 Tb/s 的单向带宽。
全局域通过混合铜-光轨道网络扩展连接,并引入光路开关(Optical Circuit Switches, OCS)。这使得 scale-up 可扩展至多达 16 个机架,即 2,048 个 XPU。
该拓扑体现了 Jalapeño 其他地方同样的原则:尽可能将高带宽通信保持在靠近计算阵列的位置,同时利用光交换扩展规模,而不必强制每个加速器都接入昂贵的全网状物理互连。
⚠️ 关键注意事项与开放问题 #
尽管效率表现具有吸引力,Jalapeño 已公布的结果仍应在其基准测试背景下加以解读。
初始工作负载覆盖有限 #
初始基准测试基于单轮 8k1k 工作负载。这为推理吞吐量提供了有用信息,但并不能说明该架构在显著不同的生产模式上的表现。
长上下文、多轮以及智能体工作负载会产生不同的内存访问模式、KV 缓存行为、并发特征与同步需求。因此,在 AgentX 等负载上的性能仍是重要的开放问题。
相关竞争基准是 Vera Rubin #
Jalapeño 可能与当前一代 Blackwell 硬件相比具有优势,但其计划于2027 年实现大规模量产,这改变了合适的竞争基准。
当 Jalapeño 达到显著生产规模时,NVIDIA 的 Vera Rubin 平台预计将成为更相关的比较对象。关键问题因此不是 Jalapeño 能否超越早期的 Blackwell 配置,而是其推理效率与系统级经济性是否仍能与下一代 GPU 基础设施竞争。
软件仍有优化空间 #
另一个重要注意事项是,已公布的基准结果是在使用单 Token 预测(STP)、且未采用**多 Token 预测(MTP)**或推测解码的情况下获得的。
这为软件栈留下了潜在的优化空间。如果 MTP 与推测解码能在 Jalapeño 上高效实现,有效 token 吞吐量可能超越初始基准结果。
然而,这些技术也会引入额外的调度、内存与接受率考量。其实际收益将取决于工作负载特性,而不是简单地将理论计算优势叠加到已公布的数字上。
🔍 Jalapeño 设计所传递的信号 #
Jalapeño 最好被理解为以推理为先的加速器设计的示例,而非试图构建通用 GPU 替代品。
其架构做出了多项有意的妥协:降低对峰值 FLOPS 的强调、不支持 FP16、采用更小的脉动阵列、局部化 HBM、乱序执行、统一的 prefill/decode 资源,以及专门围绕加速器构建的软件栈。
这些选择与以单位能量下的 tokens 为中心的生产指标是一致的。对于大规模 AI 推理而言,经济瓶颈越来越由权重与 KV 缓存的搬运成本、内存带宽的维持、可变工作负载的服务,以及在固定功耗包络下运行数千个加速器所决定。
因此,对 Jalapeño 更重要的考验将是系统级经济性,而非单一的峰值性能数字。其最终竞争力将取决于 ASIC、HBM 子系统、编译器、内核生成栈、网络结构与服务软件作为一个整体集成平台的协同效率。