跳过正文

Arm CSS for Mobile 2:C2 Ultra 与 AI 原生 G2-Ultra NX

·757 字·4 分钟
ARM 移动计算 C2 Ultra Mali G2-Ultra NX 智能体 AI 神经图形 SME2 LPDDR6 CSS for Mobile 2
目录

Arm CSS for Mobile 2:C2 Ultra 与 AI 原生 G2-Ultra NX

从生成式 AI 向智能体 AI(Agentic AI)的转变,正在改变移动计算硬件需要优化的方向。设备端智能体不再只是处理单个提示并返回响应,而是需要持续感知意图、检索上下文、进行推理,并在多个应用间执行动作。

这种工作负载与传统的移动 AI 推理有本质区别。它具有延迟敏感、突发性强、内存密集和异构的特点,要求 CPU、GPU、专用加速器、内存子系统以及软件栈作为一个协调的系统来运行。

Arm 的回应是 CSS for Mobile 2,这是该公司第二代移动计算子系统,在 Everywhere China 活动上发布。Arm 将这一平台定位为以 AI 原生移动计算架构为核心,围绕全新的 C2 CPU 集群Mali G2-Ultra NXSI L2 系统互连以及日益集成的 AI 软件生态构建。

CSS for Mobile 2 不再将 CPU 和 GPU 性能视为孤立的指标,而是聚焦系统级优化。其目标是降低异构计算资源之间的延迟,同时提升持续性能与能效,以应对两项新兴工作负载:智能体 AI 与 AI 原生图形

🚀 C2 Ultra:专为智能体 AI 设计的 CPU
#

CSS for Mobile 2 的核心是 C2 CPU 集群。旗舰参考配置采用 2+6 拓扑,由两颗 C2-Ultra 核心与六颗 C2-Pro 核心组成。各核心通过 DynamIQ Shared Unit(DSU)共享 L3 缓存。

C2-Ultra 是 Arm 本代最高性能的移动 CPU 核心。Arm 报告称,其 GeekBench 6.3 单线程性能提升 15%,多线程性能提升 12%,Speedometer 3.1 提升 15%,应用启动时间缩短 12%。

在同等性能下,C2-Ultra 相比上一代 C1-Ultra 功耗降低 38%

这些提升并非单纯依靠频率提升。Arm 的架构改进主要聚焦执行宽度、数据移动与分支预测。

更大的执行引擎
#

C2-Ultra 工作频率超过 4.45 GHz,峰值性能提升超过 15%。

更重要的是,该核心能够同时保持更多指令在飞行中,提升指令级并行度(ILP)。改进的推测执行允许在依赖项解析过程中继续进行有用工作,从而减少空闲周期和执行停顿。

对智能体 AI 而言,这一点尤为关键,因为 CPU 负责大量编排层工作。它必须协调模型调用、内存检索、应用执行以及异构加速器之间的通信,而不能成为串行瓶颈。

更高效的数据移动
#

C2-Ultra 还增强了管理未完成内存操作的能力。

更大的 Load/Store 缓冲区使处理器能够跟踪更多并发内存请求,改进的预取机制则尝试在数据被显式请求前,将可预测的数据提前载入缓存层次。

综合效果是后端停顿时间减少,对不规则或内存依赖型访问模式的工作负载执行更快。

这对智能体工作负载尤为相关,因为小模型、向量检索、应用状态和编排逻辑会反复在内存层次中移动数据。

更准确的分支预测
#

分支预测也在多种工作负载上得到改进,包括浏览器执行与应用启动。

更强的指令取指、目标地址预测以及更快的误预测恢复,有助于维持更稳定的指令流,同时减少在错误路径上的推测执行资源浪费。

对延迟敏感的工作负载而言,这些改进很重要,因为智能体流水线通常由许多短处理阶段组成,而非单一的长计算密集型内核。

🧠 SME2 与 LUTi 加速设备端 AI
#

C2-Ultra 的 AI 能力不仅限于通用 CPU 改进,还通过支持 SME2(Scalable Matrix Extension 2) 得到扩展。

智能体 AI 并不一定需要单一大模型完成所有任务。实际的设备端智能体可以组合多个专用模型,分别负责语音识别、内存检索、分类、推理等功能。

这些较小的模型正是 CPU 端矩阵加速能够发挥作用的地方。

SME2 提升了适合矩阵导向工作负载的计算密度,而 C2-Ultra 还增加了 LUTi(Lookup Table)指令,用于查找密集型操作。

LUTi 对极低精度量化模型尤为相关,可减少重复内存访问,从而缓解内存带宽压力。

编码与解码的互补优化
#

这两种能力针对推理流水线的不同部分。

在编码阶段,计算往往主导执行,因此 SME2 更高的计算密度更有价值;在解码阶段,内存带宽常常成为限制因素,高效的查找与数据移动则变得更加重要。

由此形成互补优化路径:

  • SME2 提升矩阵密集型操作的计算吞吐量。
  • LUTi 降低查找密集型工作负载的内存访问开销。
  • 二者共同应对小模型推理中的计算受限与带宽受限部分。

Arm 报告称,使用两颗支持 SME2 的 C2-Ultra 核心,相比两颗支持 SME2 的 C1-Ultra 核心,在语音识别、个人内存检索与推理工作负载上平均可获得 1.7× 的性能提升。

测试工作负载包括用于语音识别的 Moonshine 和 Parakeet、用于多语言内存检索的 LFM 2.5-ColBERT-350M,以及多个小型推理模型,包括 LFM 2.5 1.2B、Qwen 3.5 0.8B/2B、MiniCPM 5 1B 和 Gemma 4 E2B。

智能体 AI 延迟
#

Arm 还演示了 C2-Ultra 在基于规划周年晚宴的智能体工作流中的表现。

与 C1-Ultra 相比:

  • 语音转文字快 40%
  • 内存检索快 41%
  • 结构化提示推理快 25%

整体处理时间从约 450 ms 降至 280 ms,启用 SME2 后,该演示工作流的延迟进一步降低 24%。

其意义不在于单一基准数字,而在于降低串行流水线各阶段延迟的累积效应。当感知、检索、推理与执行串联时,各阶段的改进会叠加,带来更灵敏的用户体验。

灵活的 CPU 配置
#

Arm 还为 C2 系列提供配置灵活性。

合作伙伴可选择从入门级 2N 设计到旗舰 2U+6Pro 实现的多种配置。Ultra、Pro 与 Nano 微架构层级可在同一集群内混合,不同核心类别可独立扩展频率。

这使 SoC 设计者能够在性能、面积、功耗与产品定位之间进行平衡,而无需采用单一固定 CPU 配置。

🎮 Mali G2-Ultra NX:Arm 首款 AI 原生 Mali GPU
#

CPU 端 AI 加速解决了智能体编排问题,但移动图形面临不同挑战。

现代游戏日益结合高分辨率渲染、大型虚拟化环境、复杂着色器与光追。然而移动 GPU 受严格热与功耗约束,通常仅在数瓦范围内工作。

在这些约束下,每帧对每个像素进行原生渲染变得越来越困难。

Arm 的答案是 神经图形(Neural Graphics):仅对最重要的信息进行原生渲染,并利用神经重建生成额外的图像细节、帧与光追信息。

Mali G2-Ultra NX 是 Arm 首款围绕这一 AI 原生方法设计的 Mali GPU。

其架构结合了神经加速、重新设计的执行引擎以及第三代光追单元。

集成到着色器核心的神经加速器
#

神经加速器(NX)直接集成到 GPU 的着色器架构中,而非作为完全独立的加速器运行。

该单元支持 INT8 与 INT16 计算、张量操作、权重压缩,并可在高达 GPU 频率两倍的速度下工作。它还配备运动引擎与光流加速。

这种紧密集成使神经图形工作负载能够与传统图形和计算工作负载共享 GPU 缓存与内存基础设施。

架构上的好处是减少独立处理块之间的数据移动。神经操作可更贴近图形流水线,而无需在不同加速器间反复传输中间结果。

全新执行引擎
#

Mali G2-Ultra NX 还引入了大幅重新设计的执行引擎(EE),这是自 Arm 第七代 GPU 架构以来最大的 ISA 级变更。

该设计专门针对 Unreal Engine 5 技术相关工作负载,例如 Nanite 虚拟化几何与 Lumen 动态全局光照。

一个重要问题是寄存器溢出。随着着色器变得更大更复杂,寄存器容量不足会迫使临时值写入内存,显著降低性能。

新执行引擎将每个 Warp 的寄存器容量翻倍,并支持以 16-Warp 粒度进行动态宽寄存器分配。

目标是让更复杂的着色器保留在高效执行资源中,减少溢出,并为更大场景与更复杂视觉效果保留 GPU 余量。

第三代光追
#

第三代光追单元(RTU v3)解决了另一个主要的移动图形瓶颈:场景几何。

随着三角形数量增加,传统 BVH 结构会消耗大量缓存与内存容量。RTU v3 引入更紧凑的三角形表示,避免共享顶点与重复边的冗余存储。

这增加了可装入缓存的有用几何数量,同时降低 DRAM 带宽需求。

该架构还引入硬件级 不透明度微地图(Opacity Micromaps,OMM),改善对树叶与围栏等透明及半透明几何的射线命中测试。

Arm 报告称,OMM 最高可将帧率提升 30%,同时将适用场景的光追工作负载降低最高 70%。

✨ 神经图形:NSS、NFRU 与 NSSD
#

G2-Ultra NX 利用其神经架构引入三项主要神经图形技术:神经超级采样(NSS)神经帧率提升(NFRU) 以及 神经超级采样与去噪(NSSD)

这些技术针对图形流水线的不同阶段。

神经超级采样
#

NSS 以较低基础分辨率进行渲染,并使用神经网络重建更高分辨率的图像。

Arm 演示了从 540p 输入重建到 1080p 输出,将原生渲染像素数量减少到约原生 1080p 的四分之一。

在持续功耗约束下,Arm 报告称可获得 1.9–2.1× 的帧率提升,DRAM 带宽开销降低 50%,每帧动态能耗降低 50%–60%。

关键优势在于,GPU 仅在视觉价值最高的地方投入昂贵的原生渲染资源,而由神经流水线重建额外细节。

神经帧率提升
#

NFRU 利用连续原生帧的颜色、深度与运动向量信息,并结合硬件光流加速。

神经模型在原生帧之间生成中间帧,使感知输出帧率得以提升,而无需 GPU 从头完整渲染每一帧。

在 Arm 的测试中,NFRU 将持续游戏输出从 60 FPS 提升至 120 FPS,同时将 DRAM 访问流量降低约 33%。

当渲染吞吐量而非图像重建质量成为主要限制时,这种方法尤为有用。

神经超级采样与去噪
#

NSSD 针对光追工作负载。

移动光追常因功耗与计算约束而以相对较低的采样数运行,生成的图像可能包含大量高频噪声。

NSSD 不再将超级采样与去噪视为独立操作,而是将它们合并为神经重建阶段,同时提升图像质量并去除光追噪声。

这使得平台能够生成高分辨率光追输出,而无需 GPU 原生计算每一个采样。

🕹️ 真实游戏中的神经图形
#

Arm 已通过 Hugging Face 与 GitHub 开源其 NSS 与 NFRU 模型,并为 Unreal Engine 等引擎提供集成。

Arm 估计,适配现有游戏大约需要 3–6 个月,而针对该技术的新游戏开发可能少于 18 个月。

公司还演示了与 Sumo Digital 共同开发的移动游戏 Neural Dawn

该游戏使用 Unreal Engine 5.5 MegaLights,可支持多达 1,400 个动态光源,而无需依赖预烘焙光照。

在上一代 CSS G1-Ultra 平台上,该工作负载据称约以 15 FPS 运行。在 Mali G2-Ultra NX 上,Arm 演示了持续 60 FPS 的性能。

这代表声称的 4× 帧率提升、能效提高 70% 以及 DRAM 流量降低 70%。

Arm 表示,Neural Dawn 计划于 2026 年与首批基于 Mali G2-Ultra NX 的设备同步发布。

传统图形性能
#

G2-Ultra NX 不仅限于神经渲染改进。

Arm 报告称,传统光栅化与基线光追游戏性能均提升 9%。在选定基准中,报告的提升包括:

  • Steel Nomad Light: +17%
  • InVitro 2: +18%
  • AnTuTu v11: +20%
  • Solar Bay Extreme: +24%

总体而言,Arm 报告平均游戏性能约提升 20%,光追工作负载的单帧 DRAM 带宽需求下降 14%。

🔗 SI L2:连接计算子系统
#

提升 CPU 与 GPU 性能只有在 SoC 其他部分能够高效移动数据时才有意义。

因此,CSS for Mobile 2 用 SI L2 取代了之前的 SI L1 互连。这是一种通道化系统互连,用于连接 C2 CPU 集群、Mali G2-Ultra NX、统一内存与外设。

这一层对 AI 工作负载尤为重要,因为 CPU 与 GPU 经常需要共享中间数据。

带宽与内存
#

SI L2 支持 LPDDR6,提供日益计算密集的移动工作负载所需的带宽。

更高的内存吞吐量对 AI 推理与图形都很重要,但带宽本身并不能决定系统响应性。

内存延迟
#

Arm 报告称,与 SI L1 相比,CPU 与 DRAM 之间的按需加载延迟约降低 45%

这对智能体 AI 尤为重要,因为多个短操作可能因内存依赖而被串行化。

降低单个内存事务的延迟,对感知响应性的影响可能大于单纯提升峰值计算吞吐量。

一致性与 QoS
#

SI L2 提供可扩展的硬件强制一致性,以及针对不同流量类别的高级服务质量机制。

这使 CPU 与 GPU 工作负载能够共享内存,同时在并发负载下保持可预测的访问行为。

对异构 AI 工作负载而言,这种协调至关重要,因为独立加速器否则可能竞争相同的内存与互连资源。

安全性与物理效率
#

该互连还支持 Memory Tagging Extension(MTE)Distributed Virtual Memory(DVM) 等技术,同时以低面积与功耗开销为目标。

由此形成的架构旨在在移动 SoC 中平衡性能、安全性、一致性与物理实现约束。

🛠️ 开箱即用 AI 的软件生态
#

硬件加速只有在软件能够高效暴露时才有用。

因此,Arm 围绕 C2 与 G2-Ultra NX 构建了软件栈,而非将硬件视为孤立的 IP 块。

KleidiAI
#

Arm 的 KleidiAI 作为 AI 工作负载的核心硬件-软件优化层。

Arm 报告称,它已集成到超过 100 个第三方应用中,并适配超过 12 个主要 AI 框架。

该栈包含超过 200 个优化微内核与约 140,000 行代码,为 Arm CPU 提供优化执行路径。

如 Qwen3-TTS 与 HY-MT1.5-1.8B-2Bit 等模型可受益于这些优化,并在 C2-Ultra 的 SME2 资源上执行。

Arm AI Portal
#

全新的 Arm AI Portal 为设备端 AI 开发者提供集中环境。

它包含优化模型、性能与精度测量、示例代码以及部署资源。MCP 服务器集成也面向智能体 AI 开发工作流。

开发者可在 Arm 硬件上评估模型、比较工作负载特征,并更快地从模型选择推进到部署。

Arm 还为处理专有模型的开发者提供早期访问优化工具。

Arm Neural Graphics SDK
#

对图形开发者而言,Arm Neural Graphics SDK(ArmNG SDK) 提供 NSS 与 NFRU 的开源模型,以及 Vulkan ML 扩展、Unreal Engine 插件与自定义引擎 SDK。

该工具包还包含性能分析、图形优化、训练与模型调优能力。

这一软件层至关重要,因为神经图形并非单纯的硬件功能。游戏引擎、渲染流水线、模型执行与开发者工具都需要高效暴露底层加速。

🌐 从更快组件到系统级 AI
#

CSS for Mobile 2 反映了 Arm 移动计算策略的更广泛转变。

智能体 AI 与 AI 原生图形有不同的性能需求,但两者都暴露了独立优化单个 IP 块的局限。

智能体 AI 而言,关键指标是端到端延迟。语音识别、内存检索、推理与应用执行形成串行流水线,延迟会累积。因此 Arm 强调 C2-Ultra CPU 性能、SME2、LUTi 以及 SI L2 内存延迟。

AI 原生图形 而言,吞吐量与能效占主导。在移动功耗限制下,对每个像素与每一帧进行原生渲染成本日益高昂。G2-Ultra NX 转而结合选择性渲染与神经重建、运动处理以及光追加速。

共同的关键点是 系统级协调

CPU 性能、GPU 吞吐量、内存带宽、内存延迟、缓存利用率、互连一致性、加速器集成以及软件优化,都共同决定最终用户可见的结果。

这正是 CSS for Mobile 2 背后的核心架构信息:在 AI 原生移动时代,单纯将更快的 CPU 与更快的 GPU 组合已不再足够。性能上限越来越取决于整个计算子系统如何高效移动数据、调度异构工作负载,并持续为专用资源提供数据。

因此,C2-Ultra 与 Mali G2-Ultra NX 不仅仅是两个新的处理器模块。它们与 SI L2 以及 Arm 的软件栈一起,构成了平台级尝试,旨在使移动设备能够在严格的功耗与热约束下运行日益复杂的 AI 智能体与神经图形工作负载。

然而,最终检验将来自商业旗舰 SoC。真实世界基准将决定这一紧密集成的架构,如何有效地将 Arm 声称的改进转化为持续的移动性能、响应性与能效。

相关文章

Qualcomm Oryon CPU 以全新 FlexCache 设计达到 5GHz
·280 字·2 分钟
Qualcomm Oryon Snapdragon 移动 CPU FlexCache 智能体 AI 端侧 AI CPU 架构 移动计算
Exynos 2700疑似采用RDNA 5:能否挑战骁龙旗舰?
·250 字·2 分钟
三星Exynos Exynos 2700 AMD RDNA 5 Xclipse 970 三星晶圆代工 移动GPU 骁龙 ARM 手机SoC
CXMT LPDDR6量产:国产移动DRAM迈入全球第一梯队
·207 字·1 分钟
长鑫存储 CXMT LPDDR6 DRAM 移动内存 小米 半导体 端侧AI