跳过正文

NVIDIA公布RISC-V接入CUDA与NVLink Fusion平台标准

·227 字·2 分钟
NVIDIA RISC-V CUDA NVLink Fusion NVLink C2C AI服务器 SiFive Hot Chips 2026
目录

NVIDIA公布RISC-V接入CUDA与NVLink Fusion平台标准

在Hot Chips 2026的一场技术教程会议上,NVIDIA首次系统介绍了将RISC-V服务器CPU接入CUDA与NVLink Fusion生态所需满足的平台标准。

这次披露的重点并不是某款具体RISC-V处理器,而是一套面向服务器级平台的软硬件准入要求,覆盖CPU ISA与二进制兼容性、固件标准、PCIe硬件一致性、PCIe点对点通信,以及更高带宽的NVLink C2C互连。

换句话说,RISC-V进入NVIDIA CUDA生态并不只是完成一次ISA移植,而是需要让整个服务器平台具备可复用、可标准化的软硬件基础。

🧩 CUDA对RISC-V服务器CPU提出哪些要求?
#

CUDA是NVIDIA的GPU并行计算平台。在典型CUDA工作负载中,GPU负责大规模并行计算,而CPU承担串行控制、任务调度以及部分数据处理工作。

目前CUDA主机侧软件主要支持x86和Arm架构。如果进一步加入RISC-V,首先需要解决的是CPU的软件兼容性以及服务器平台标准化问题。

NVIDIA列出的核心CPU侧要求包括:

类别 NVIDIA要求
CPU ISA RISC-V RVA23 Profile
启动与运行时 RISC-V Boot and Runtime Services(BRS)
服务器平台 RISC-V Server SoC and Platform规范
固件 ACPI 6.6及RISC-V相关支持
I/O PCIe硬件级I/O一致性
多设备通信 PCIe Peer-to-Peer(P2P)

其中,RVA23 Profile是重要基础。相比只支持某些基础RISC-V指令集扩展,Profile通过规定一组标准化的ISA与扩展组合,可以降低不同厂商CPU之间的软件兼容性差异。

对于CUDA生态而言,这意味着软件不需要为了适配不同RISC-V CPU实现而不断针对最低共同特性进行妥协。

二进制兼容性成为关键
#

服务器生态尤其依赖稳定的软件栈。如果不同RISC-V处理器在指令集、平台接口或系统服务方面存在明显差异,那么同一个软件二进制文件可能无法直接跨平台运行。

因此,NVIDIA强调的不仅是RISC-V ISA本身,还包括RISC-V服务器SoC与Platform规范以及BRS等标准。

其目标是让不同厂商的RISC-V服务器CPU拥有更加一致的平台行为,为CUDA主机软件提供可预测的运行环境。

⚙️ 固件与ACPI标准同样重要
#

CPU指令集只是服务器平台的一部分。

要让操作系统、虚拟化软件、驱动程序以及CUDA相关软件正常工作,启动流程、硬件发现、电源管理和运行时服务同样需要标准化。

ACPI 6.6在2025年获得UEFI Forum批准,并加入了对RISC-V的支持。随后发布的RISC-V Boot and Runtime Services规范进一步完善了服务器启动与运行时环境所需要的标准接口。

因此,NVIDIA此次提出的路线实际上覆盖了:

ISA → 固件 → 操作系统 → 驱动 → CUDA软件栈

这也是为什么RISC-V进入CUDA生态不能简单理解为“重新编译CUDA”。

🔄 PCIe硬件一致性是CUDA平台的重要基础
#

CUDA工作负载通常涉及大量CPU与GPU之间的数据交换。

典型流程可能包括:

Host-to-Device → Kernel Launch → Device-to-Host → CPU Processing

如果CPU和设备之间缺乏硬件级缓存一致性机制,那么软件需要频繁执行缓存刷新与失效操作,从而增加实现复杂度和数据访问延迟。

因此,NVIDIA将**PCIe I/O硬件一致性(I/O Coherency)**列为RISC-V CUDA平台的重要要求之一。

硬件一致性机制能够减少软件层面的缓存维护操作,让CPU、GPU以及其他PCIe设备之间的数据访问更加高效。

对于高性能AI服务器而言,这种能力尤其重要,因为大量工作负载并不是简单地“CPU计算一次、GPU计算一次”,而是持续在主机内存与设备内存之间交换数据。

🔗 PCIe P2P为多GPU扩展提供基础
#

另一项重要能力是PCIe Peer-to-Peer,也就是PCIe P2P

在多GPU服务器中,P2P允许一个GPU直接向另一个GPU的设备内存写入数据,而无需先将数据复制到主机内存。

例如:

GPU 0
  │ PCIe P2P
GPU 1
Device Memory

这种数据路径可以绕过CPU主机内存,减少不必要的数据搬运,并提高多GPU协作效率。

对于AI训练、推理以及GPU间通信密集型工作负载而言,P2P因此成为服务器级RISC-V + CUDA平台的重要基础能力。

这些要求也说明,NVIDIA所瞄准的并不是面向嵌入式设备的RISC-V方案,而是拥有完整I/O、内存和服务器平台能力的高性能RISC-V服务器CPU

🚀 NVLink Fusion进一步提高互连要求 #

如果PCIe可以视为RISC-V CPU接入CUDA生态的基础路径,那么NVLink Fusion则代表了更高性能、更深层次的CPU-GPU整合方式。

NVLink Fusion允许定制CPU通过**NVLink C2C(Chip-to-Chip)**连接XPU,并提供高带宽互连以及CHI一致性支持。

其目标是让CPU与GPU能够更加紧密地共享和访问内存资源,从而构建更接近统一内存架构的高性能计算平台。

与普通PCIe连接相比,这意味着CPU厂商需要满足更高等级的互连、缓存一致性以及软件生态要求。

NVLink Fusion需要哪些额外能力? #

采用NVLink Fusion的定制CPU首先需要继承前述CUDA平台要求,同时还需要支持更高带宽的芯片间互连。

NVIDIA给出的带宽级别大致相当于88条PCIe通道,同时要求配套的软件生态支持,包括:

  • DOCA网络与基础设施软件栈
  • NCCL多GPU通信库
  • 高带宽C2C互连
  • CHI一致性
  • CUDA软件生态兼容性

因此,NVLink Fusion并不是简单增加一个高速接口,而是要求CPU从硬件接口到软件栈都融入NVIDIA的AI计算平台。

🏭 Vera Rubin展示全栈协同设计思路
#

NVIDIA的Vera Rubin AI Factory平台正体现了这种高度整合的设计理念。

其平台通过多个芯片以及不同机架层级进行协同设计,将CPU、GPU、网络、存储和Scale-out互连连接成完整系统,最终形成NVL72等全机架AI计算产品。

这一架构反映出NVIDIA当前AI基础设施的发展方向:

CPU不再只是GPU旁边负责调度任务的通用处理器,而是整个AI计算系统中的一个高速、连贯的组成部分。

对于RISC-V厂商而言,这也意味着未来进入NVIDIA高端AI服务器生态时,需要考虑的已经不仅是CPU性能,而是CPU与GPU、网络和内存系统之间的整体协同能力。

🧠 SiFive成为目前公开的RISC-V合作方
#

目前公开披露的RISC-V合作伙伴包括SiFive。

SiFive在2026年1月宣布,将把NVLink Fusion整合到其面向高性能数据中心的RISC-V解决方案中,使其CPU能够通过高带宽、一致性的NVLink连接NVIDIA GPU和加速器。

这为RISC-V服务器CPU进入NVIDIA AI计算生态提供了一个实际案例。

不过,此次Hot Chips 2026教程的重点仍然是平台标准,而不是公布某款具体RISC-V芯片的性能、功耗或上市信息。因此,不应将这些平台要求直接解读为NVIDIA已经推出了某款RISC-V服务器处理器。

🧱 RISC-V进入CUDA生态的真正门槛
#

从NVIDIA此次公布的要求来看,RISC-V接入CUDA生态可以分成几个层级:

RISC-V ISA
RVA23 Profile
BRS / Server SoC / Platform
ACPI与标准固件
PCIe I/O Coherency
PCIe P2P
CUDA主机软件栈
NVLink C2C / CHI
NVLink Fusion
高密度AI服务器

这套路径说明,ISA兼容只是起点,平台标准化才是RISC-V进入CUDA生态的核心问题之一。

对于RISC-V CPU厂商而言,满足这些标准可以降低进入GPU加速服务器市场的门槛;对于NVIDIA而言,则可以通过标准化接口扩大未来定制CPU的选择范围,同时保持CUDA生态的一致性。

🏁 总结
#

Hot Chips 2026上NVIDIA披露的RISC-V平台要求,释放出一个清晰信号:RISC-V正在获得进入主流GPU加速服务器生态的标准化入口,但真正的挑战远不止ISA移植。

从RVA23、BRS和Server Platform规范,到ACPI、PCIe硬件一致性和P2P,再到NVLink C2C、CHI以及NVLink Fusion,NVIDIA实际上正在定义一整套面向RISC-V服务器CPU的生态准入条件。

这意味着未来RISC-V与CUDA的结合,更可能表现为CPU、GPU、内存、I/O、互连和软件栈共同协作的完整平台,而不是单纯将CUDA软件移植到另一种CPU指令集架构上。

随着SiFive等厂商推进NVLink Fusion方案,RISC-V在高性能AI服务器中的实际落地值得继续关注。最终能否形成规模化生态,还将取决于CPU性能、互连带宽、软件兼容性、系统设计以及多GPU扩展能力。

相关文章

Google esh:面向 ARM 与 RISC-V 的轻量级嵌入式 Shell
·579 字·3 分钟
Google Esh 嵌入式系统 裸机 ARM RISC-V UART QEMU 调试
Agentic AI 与全球生产力:AI4X 调研框架解析
·532 字·3 分钟
Agentic AI AI 生产力 AI Agents AI4X 自动化 多智能体系统 AI 经济学 企业 AI
TUXEDO OS弃用Ubuntu转向Debian Testing:Snap成关键因素
·385 字·2 分钟
TUXEDO OS Debian Testing Ubuntu Linux KDE Plasma Btrfs Snap Linux笔记本 开源