NVIDIA公布RISC-V接入CUDA与NVLink Fusion平台标准
在Hot Chips 2026的一场技术教程会议上,NVIDIA首次系统介绍了将RISC-V服务器CPU接入CUDA与NVLink Fusion生态所需满足的平台标准。
这次披露的重点并不是某款具体RISC-V处理器,而是一套面向服务器级平台的软硬件准入要求,覆盖CPU ISA与二进制兼容性、固件标准、PCIe硬件一致性、PCIe点对点通信,以及更高带宽的NVLink C2C互连。
换句话说,RISC-V进入NVIDIA CUDA生态并不只是完成一次ISA移植,而是需要让整个服务器平台具备可复用、可标准化的软硬件基础。
🧩 CUDA对RISC-V服务器CPU提出哪些要求? #
CUDA是NVIDIA的GPU并行计算平台。在典型CUDA工作负载中,GPU负责大规模并行计算,而CPU承担串行控制、任务调度以及部分数据处理工作。
目前CUDA主机侧软件主要支持x86和Arm架构。如果进一步加入RISC-V,首先需要解决的是CPU的软件兼容性以及服务器平台标准化问题。
NVIDIA列出的核心CPU侧要求包括:
| 类别 | NVIDIA要求 |
|---|---|
| CPU ISA | RISC-V RVA23 Profile |
| 启动与运行时 | RISC-V Boot and Runtime Services(BRS) |
| 服务器平台 | RISC-V Server SoC and Platform规范 |
| 固件 | ACPI 6.6及RISC-V相关支持 |
| I/O | PCIe硬件级I/O一致性 |
| 多设备通信 | PCIe Peer-to-Peer(P2P) |
其中,RVA23 Profile是重要基础。相比只支持某些基础RISC-V指令集扩展,Profile通过规定一组标准化的ISA与扩展组合,可以降低不同厂商CPU之间的软件兼容性差异。
对于CUDA生态而言,这意味着软件不需要为了适配不同RISC-V CPU实现而不断针对最低共同特性进行妥协。
二进制兼容性成为关键 #
服务器生态尤其依赖稳定的软件栈。如果不同RISC-V处理器在指令集、平台接口或系统服务方面存在明显差异,那么同一个软件二进制文件可能无法直接跨平台运行。
因此,NVIDIA强调的不仅是RISC-V ISA本身,还包括RISC-V服务器SoC与Platform规范以及BRS等标准。
其目标是让不同厂商的RISC-V服务器CPU拥有更加一致的平台行为,为CUDA主机软件提供可预测的运行环境。
⚙️ 固件与ACPI标准同样重要 #
CPU指令集只是服务器平台的一部分。
要让操作系统、虚拟化软件、驱动程序以及CUDA相关软件正常工作,启动流程、硬件发现、电源管理和运行时服务同样需要标准化。
ACPI 6.6在2025年获得UEFI Forum批准,并加入了对RISC-V的支持。随后发布的RISC-V Boot and Runtime Services规范进一步完善了服务器启动与运行时环境所需要的标准接口。
因此,NVIDIA此次提出的路线实际上覆盖了:
ISA → 固件 → 操作系统 → 驱动 → CUDA软件栈
这也是为什么RISC-V进入CUDA生态不能简单理解为“重新编译CUDA”。
🔄 PCIe硬件一致性是CUDA平台的重要基础 #
CUDA工作负载通常涉及大量CPU与GPU之间的数据交换。
典型流程可能包括:
Host-to-Device → Kernel Launch → Device-to-Host → CPU Processing
如果CPU和设备之间缺乏硬件级缓存一致性机制,那么软件需要频繁执行缓存刷新与失效操作,从而增加实现复杂度和数据访问延迟。
因此,NVIDIA将**PCIe I/O硬件一致性(I/O Coherency)**列为RISC-V CUDA平台的重要要求之一。
硬件一致性机制能够减少软件层面的缓存维护操作,让CPU、GPU以及其他PCIe设备之间的数据访问更加高效。
对于高性能AI服务器而言,这种能力尤其重要,因为大量工作负载并不是简单地“CPU计算一次、GPU计算一次”,而是持续在主机内存与设备内存之间交换数据。
🔗 PCIe P2P为多GPU扩展提供基础 #
另一项重要能力是PCIe Peer-to-Peer,也就是PCIe P2P。
在多GPU服务器中,P2P允许一个GPU直接向另一个GPU的设备内存写入数据,而无需先将数据复制到主机内存。
例如:
GPU 0
│
│ PCIe P2P
▼
GPU 1
│
▼
Device Memory
这种数据路径可以绕过CPU主机内存,减少不必要的数据搬运,并提高多GPU协作效率。
对于AI训练、推理以及GPU间通信密集型工作负载而言,P2P因此成为服务器级RISC-V + CUDA平台的重要基础能力。
这些要求也说明,NVIDIA所瞄准的并不是面向嵌入式设备的RISC-V方案,而是拥有完整I/O、内存和服务器平台能力的高性能RISC-V服务器CPU。
🚀 NVLink Fusion进一步提高互连要求 #
如果PCIe可以视为RISC-V CPU接入CUDA生态的基础路径,那么NVLink Fusion则代表了更高性能、更深层次的CPU-GPU整合方式。
NVLink Fusion允许定制CPU通过**NVLink C2C(Chip-to-Chip)**连接XPU,并提供高带宽互连以及CHI一致性支持。
其目标是让CPU与GPU能够更加紧密地共享和访问内存资源,从而构建更接近统一内存架构的高性能计算平台。
与普通PCIe连接相比,这意味着CPU厂商需要满足更高等级的互连、缓存一致性以及软件生态要求。
NVLink Fusion需要哪些额外能力? #
采用NVLink Fusion的定制CPU首先需要继承前述CUDA平台要求,同时还需要支持更高带宽的芯片间互连。
NVIDIA给出的带宽级别大致相当于88条PCIe通道,同时要求配套的软件生态支持,包括:
- DOCA网络与基础设施软件栈
- NCCL多GPU通信库
- 高带宽C2C互连
- CHI一致性
- CUDA软件生态兼容性
因此,NVLink Fusion并不是简单增加一个高速接口,而是要求CPU从硬件接口到软件栈都融入NVIDIA的AI计算平台。
🏭 Vera Rubin展示全栈协同设计思路 #
NVIDIA的Vera Rubin AI Factory平台正体现了这种高度整合的设计理念。
其平台通过多个芯片以及不同机架层级进行协同设计,将CPU、GPU、网络、存储和Scale-out互连连接成完整系统,最终形成NVL72等全机架AI计算产品。
这一架构反映出NVIDIA当前AI基础设施的发展方向:
CPU不再只是GPU旁边负责调度任务的通用处理器,而是整个AI计算系统中的一个高速、连贯的组成部分。
对于RISC-V厂商而言,这也意味着未来进入NVIDIA高端AI服务器生态时,需要考虑的已经不仅是CPU性能,而是CPU与GPU、网络和内存系统之间的整体协同能力。
🧠 SiFive成为目前公开的RISC-V合作方 #
目前公开披露的RISC-V合作伙伴包括SiFive。
SiFive在2026年1月宣布,将把NVLink Fusion整合到其面向高性能数据中心的RISC-V解决方案中,使其CPU能够通过高带宽、一致性的NVLink连接NVIDIA GPU和加速器。
这为RISC-V服务器CPU进入NVIDIA AI计算生态提供了一个实际案例。
不过,此次Hot Chips 2026教程的重点仍然是平台标准,而不是公布某款具体RISC-V芯片的性能、功耗或上市信息。因此,不应将这些平台要求直接解读为NVIDIA已经推出了某款RISC-V服务器处理器。
🧱 RISC-V进入CUDA生态的真正门槛 #
从NVIDIA此次公布的要求来看,RISC-V接入CUDA生态可以分成几个层级:
RISC-V ISA
↓
RVA23 Profile
↓
BRS / Server SoC / Platform
↓
ACPI与标准固件
↓
PCIe I/O Coherency
↓
PCIe P2P
↓
CUDA主机软件栈
↓
NVLink C2C / CHI
↓
NVLink Fusion
↓
高密度AI服务器
这套路径说明,ISA兼容只是起点,平台标准化才是RISC-V进入CUDA生态的核心问题之一。
对于RISC-V CPU厂商而言,满足这些标准可以降低进入GPU加速服务器市场的门槛;对于NVIDIA而言,则可以通过标准化接口扩大未来定制CPU的选择范围,同时保持CUDA生态的一致性。
🏁 总结 #
Hot Chips 2026上NVIDIA披露的RISC-V平台要求,释放出一个清晰信号:RISC-V正在获得进入主流GPU加速服务器生态的标准化入口,但真正的挑战远不止ISA移植。
从RVA23、BRS和Server Platform规范,到ACPI、PCIe硬件一致性和P2P,再到NVLink C2C、CHI以及NVLink Fusion,NVIDIA实际上正在定义一整套面向RISC-V服务器CPU的生态准入条件。
这意味着未来RISC-V与CUDA的结合,更可能表现为CPU、GPU、内存、I/O、互连和软件栈共同协作的完整平台,而不是单纯将CUDA软件移植到另一种CPU指令集架构上。
随着SiFive等厂商推进NVLink Fusion方案,RISC-V在高性能AI服务器中的实际落地值得继续关注。最终能否形成规模化生态,还将取决于CPU性能、互连带宽、软件兼容性、系统设计以及多GPU扩展能力。