AMD Threadripper Halo Station:96核CPU与四GPU本地AI工作站
AMD正在将本地AI计算能力推向高端工作站领域。全新的 Threadripper Halo Station 是一款采用液冷设计的桌面级AI工作站,目标是在不依赖云端的情况下运行超大规模AI模型。
在IFA 2026主题演讲中,AMD正式展示了这套系统。它采用96核AMD Threadripper PRO 9995WX处理器,并可搭载最多4张AMD Instinct MI350P加速卡。满配情况下,整机可提供高达576GB HBM3E显存,同时支持最高2TB DDR5系统内存。
AMD高级副总裁兼计算与图形事业部总经理Jack Huynh将其称为“全球最强工作站”,并将本地运行超过1万亿参数AI模型作为核心应用场景之一。
这套平台真正值得关注的不只是计算性能和显存容量,还包括其产品形态。AMD没有把如此高功耗的硬件放进传统机架式服务器,而是通过独立液冷系统,将其设计成可以放在桌边运行的工作站。
不过,目前仍有几个关键问题没有答案,包括价格、上市时间、加速卡之间的互联方式、整机供电方案,以及多GPU运行大模型时的实际性能。
🧠 Threadripper PRO与MI350P构成核心硬件 #
Threadripper Halo Station将AMD高端工作站CPU平台与企业级AI加速器组合在一起。
96核Threadripper PRO 9995WX #
演示机采用基于Zen 5架构的Threadripper PRO 9995WX处理器。
主要规格包括:
- 96个CPU核心
- 192线程
- 最高5.4GHz加速频率
- 最高支持2TB DDR5内存
- 八通道内存架构
- 128条PCIe 5.0通道
对于多GPU AI工作站而言,大量PCIe通道非常重要。系统需要为多张高功耗AI加速卡提供足够的高速I/O资源,否则CPU平台本身就可能成为多卡扩展的瓶颈。
双Instinct MI350P加速卡 #
演示机在Threadripper CPU之外配备了两张Instinct MI350P。
MI350P基于AMD CDNA 4架构,面向企业级AI推理等工作负载。
每张加速卡提供:
- 144GB HBM3E
- 约4TB/s内存带宽
- 600W典型板卡功耗
- PCIe卡式设计
因此,两张MI350P可以提供总计288GB HBM3E。
机箱则预留了最多安装4张加速卡的扩展空间,使满配系统能够达到576GB HBM3E。
这一显存容量是AMD本地AI战略中的关键卖点。
⚡ 双GPU配置的核心计算功耗已达1550W #
这套系统的功耗同样非常惊人。
演示机的核心计算组件包括:
- 两张600W MI350P加速卡。
- 一颗350W Threadripper PRO处理器。
仅CPU和两张加速卡的理论板卡功耗就达到约1550W。
如果进一步安装4张MI350P,则CPU加4张加速卡的理论功耗将达到约2750W。
上述数字还没有计算:
- 内存。
- 存储设备。
- 主板。
- 风扇与水泵。
- 电源转换损耗。
- 其他系统组件。
因此,对于Threadripper Halo Station而言,散热和供电工程的重要性并不亚于计算性能本身。
💧 液冷设计让高功耗硬件进入桌面环境 #
AMD采用独立液冷方案解决高功耗硬件的散热问题。
CPU和每张加速卡均采用独立液冷回路。
这里的目标不仅是避免持续高负载下发生降频,更重要的是实现适合桌边环境的低噪音运行。
这一点非常关键。
传统高功耗GPU服务器通常部署在机房,可以接受较高的风扇噪音。而放在工程师或研究人员身边的工作站则无法采用同样的噪音标准。
演示系统据称采用普通钢化玻璃侧板塔式机箱,并配备标准ATX电源形态,整体外观更接近极限性能工作站,而不是传统机架式服务器。
换句话说,AMD正在尝试把相当于数据中心级别的AI加速硬件压缩进桌面工作站形态。
🆚 AMD与NVIDIA采用不同的本地AI架构路线 #
AMD并没有回避Threadripper Halo Station与NVIDIA DGX Station之间的竞争关系,但两者采用了明显不同的系统架构。
NVIDIA的高度集成路线 #
以GB300为基础的NVIDIA DGX Station采用更加紧密的CPU-GPU集成方案。
该平台将B300加速器与Grace CPU结合,并通过高带宽NVLink-C2C连接,形成统一的相干内存架构。
相关配置提供约748GB统一内存池,NVLink-C2C带宽据称达到约900GB/s。
这种架构的优势在于CPU和GPU之间可以进行高效的数据交换和内存共享。
AMD的离散扩展路线 #
Threadripper Halo Station则采用更加模块化的设计。
它由以下部分组成:
- 高核心数x86 CPU。
- 多张PCIe AI加速卡。
- 每张加速卡独立的HBM3E。
- 大容量DDR5系统内存。
这种架构的最大特点是扩展方式比较直接:增加加速卡数量,就可以增加整体显存容量和计算资源。
四卡配置能够达到576GB HBM3E,而CPU平台则最多支持2TB系统内存。
同时,x86主机平台也可以避免部分用户从x86迁移到Arm环境时可能遇到的工具链和软件适配问题。
但代价也很明显:多GPU之间的通信效率将高度依赖底层互联架构和软件栈。
🧮 四张MI350P真的能运行万亿参数模型吗? #
AMD关于“本地运行万亿参数模型”的说法,首先是一个显存容量层面的判断,而不是对实际推理性能的承诺。
以4-bit量化为例:
1万亿参数 × 4 bit ≈ 500GB
也就是说,仅模型权重就需要大约500GB存储空间。
四张MI350P合计提供576GB HBM3E,从理论容量来看,确实足以容纳一个经过4-bit量化、参数量约1万亿的模型权重。
因此,从纯粹的显存容量角度来看,AMD的定位具有技术可行性。
但真正运行模型时,需要考虑的远不止权重。
实际推理还需要为以下内容分配显存:
- KV Cache。
- 激活值。
- 临时Buffer。
- 通信Buffer。
- Runtime元数据。
- 深度学习框架自身的内存开销。
因此,最终能够运行多大的模型,会受到量化格式、上下文长度、Batch Size、模型架构以及推理框架内存管理策略等多方面影响。
更重要的是,576GB HBM3E并不意味着系统拥有一个真正统一的576GB显存池。
四张MI350P本质上仍然是离散PCIe设备。要让一个超大模型高效分布在这些GPU上运行,就必须解决GPU之间的通信和同步问题。
🔗 多GPU互联仍然是最大未知数 #
这可能是Threadripper Halo Station目前最值得关注、同时也是信息最不完整的部分。
AMD目前尚未公开详细说明MI350P之间采用什么样的互联拓扑。
对于万亿参数级别模型而言,这一点至关重要。
系统可能需要将模型层、Tensor Parallel任务或其他计算工作分布到多张GPU上。在这种情况下,实际性能会高度依赖:
- GPU之间的互联带宽。
- 通信延迟。
- PCIe拓扑。
- NUMA布局。
- CPU到GPU带宽。
- GPU之间的同步效率。
- 模型并行软件支持。
- Collective通信效率。
因此,576GB HBM3E代表的是容量,而不是实际性能。
在AMD公布详细测试数据之前,很难判断四张MI350P在大模型推理中的扩展效率究竟如何,也无法直接将其与高度集成的AI工作站进行性能比较。
📋 Threadripper Halo Station仍缺少多项关键规格 #
虽然Threadripper Halo Station的硬件配置相当激进,但AMD目前尚未公布足够完整的信息来判断它作为量产工作站的实际竞争力。
价格与上市时间 #
AMD尚未公布最终价格以及明确的上市时间。
目前也不清楚Threadripper Halo Station究竟会由AMD直接销售,还是主要通过OEM厂商和系统集成商提供。
这将直接影响最终售价、售后支持以及可选配置。
存储与平台配置 #
目前尚未完全公开的信息还包括:
- 存储配置。
- 存储设备数量和规格。
- 主板详细架构。
- 电源容量。
- 完整液冷方案。
- GPU之间的互联方式。
- 最终固件和软件配置。
这些细节最终将决定量产版本与演示机之间到底存在多大差异。
实际AI性能 #
更关键的是,AMD还没有公布完整的AI性能测试数据,包括:
- 大模型推理吞吐量。
- Tokens Per Second。
- TPOT。
- 多GPU扩展效率。
- GPU之间的通信性能。
- 不同量化格式下的表现。
- 持续高负载下的性能与能效。
在这些数据公布之前,单纯根据显存容量和理论计算能力,很难判断Threadripper Halo Station在实际AI工作负载中的表现。
🏢 AMD正在向上扩展本地AI产品线 #
Threadripper Halo Station并不是AMD本地AI战略中的孤立产品,而是其更大范围AI硬件布局的一部分。
AMD目前正在构建覆盖多个性能级别的本地AI产品线。
较低端包括面向紧凑型系统的Ryzen AI Halo平台,以及面向笔记本和迷你PC的Ryzen AI Max PRO 400系列。
Threadripper Halo Station则位于整个产品线的顶端,通过高端Threadripper PRO处理器和多张Instinct AI加速卡,将本地AI计算能力推向工作站级别。
整体产品路线可以概括为:
笔记本 → Mini PC → 紧凑型AI系统 → 高端AI工作站
这一布局也反映出整个AI产业正在发生的变化:随着模型规模不断扩大,越来越多用户开始寻求能够脱离云端、直接在本地运行AI模型的硬件平台。
🏁 总结 #
AMD Threadripper Halo Station代表了一种相当激进的本地AI工作站设计思路。
它将96核Zen 5 Threadripper PRO 9995WX、最多4张600W MI350P加速卡以及最高576GB HBM3E整合进一套桌面级液冷系统中。
从显存容量来看,四卡配置在4-bit量化条件下理论上足以容纳约1万亿参数模型的权重,这为AMD“本地运行万亿参数AI模型”的产品定位提供了硬件基础。
但显存容量只是问题的一半。
真正决定这套平台价值的,是四张离散加速卡究竟能够以多高的效率协同工作。GPU之间的互联带宽、通信延迟、模型并行能力、内存管理、散热、供电以及软件优化,最终都会直接影响实际推理性能。
因此,目前的Threadripper Halo Station更适合被视为一个拥有极高显存容量和计算潜力的本地AI工作站平台,而不是已经完成性能验证的“桌面级AI超级计算机”。
在AMD公布价格、上市时间、GPU互联架构以及完整的多GPU AI基准测试之前,这套系统真正的市场竞争力仍然存在不少未知数。
对于希望在本地部署超大规模AI模型的开发者、研究机构和企业用户而言,接下来最值得关注的并不是AMD还能堆多少显存,而是这些显存和计算资源究竟能以多高的效率协同运行。