↓跳过正文

谷歌DeepMind AlphaChip:AI驱动的超人芯片布局设计

·59 字·1 分钟
AlphaChip DeepMind 谷歌 芯片设计 强化学习 TPU AI硬件设计 平面规划 电子设计自动化
目录

谷歌DeepMind AlphaChip:AI驱动的超人芯片布局设计

谷歌DeepMind发布了《自然》附录,详细阐述其强化学习方法在芯片平面规划中的实际影响。该方法现正式命名为AlphaChip,并同步发布预训练模型检查点与开源权重。AlphaChip可在数小时内生成高质量芯片布局,而传统人工团队通常需要数周甚至数月,其成果已在全球量产硅片中得到应用。

计算机芯片推动了现代AI的进步;AlphaChip则通过AI加速并优化这些芯片的设计,形成闭环。该系统已为谷歌最近三代张量处理单元(TPU)生成平面布局,包括最新的Trillium(第六代)设备。

🚀 AlphaChip:从研究到量产硅片
#

2020年,DeepMind发布预印本,介绍了一种用于芯片放置的新型深度强化学习方法。该工作随后发表于《自然》并开源。新附录量化了该方法对商业芯片设计的影响,并以AlphaChip之名发布预训练检查点。

AlphaChip是首批成功应用于工业级实际工程问题的强化学习系统之一。其布局已出现在数据中心加速器与移动SoC中。

联发科高管称该方法是“彻底改变了芯片设计关键阶段”的突破性AI方法。

🧠 AlphaChip的工作原理
#

芯片平面规划仍是物理设计中最棘手的问题之一。现代芯片包含数千个互连模块、多层电路元件以及密集的细导线网络,同时需满足时序、功耗、拥塞与密度等多重约束。自动化解决方案已探索超过六十年。

AlphaChip将任务重新定义为序贯游戏,类似于AlphaGo或AlphaZero。它从空白网格开始,一次放置一个电路元件。最终布局完成后,根据质量(线长、拥塞、密度等)获得奖励。

一种新颖的基于边的图神经网络使智能体能够学习元件间的关系结构,并在整个芯片范围内泛化。由于策略随着解决的放置问题实例增多而持续改进,性能随经验提升——与人类专家的进步方式一致。

⚙️ 用AI设计谷歌的TPU加速器
#

自首次发布以来,AlphaChip已为后续每一代谷歌TPU生成量产平面布局。这些加速器支撑大规模Transformer模型(Gemini)、图像与视频生成器(Imagen、Veo)以及Google Cloud AI服务。

工作流程遵循“预训练后微调”模式:

  1. 在前几代TPU的多样化模块(片上与片间网络、内存控制器、数据传输缓冲区等)上进行预训练。
  2. 在当前TPU代的目标模块上进行微调。

与早期非学习式放置器不同,AlphaChip随着任务实例积累,在速度与质量上同步提升。随着每代新TPU推出,AlphaChip设计的模块数量以及相对于人工物理设计团队的平均线长减少量均在增加:

  • TPU v5e:10个模块,线长减少3.2%
  • TPU v5p:15个模块,线长减少4.5%
  • Trillium:25个模块,线长减少6.2%

同一流水线还为谷歌基于Arm的数据中心CPU(Axion)以及其他未公开的内部芯片生成了布局。

🌍 对行业与研究的广泛影响
#

在Alphabet内部,AlphaChip已不再局限于AI加速器。外部组织也已采用并扩展该方法。联发科将增强版集成到其天玑旗舰5G移动SoC的开发流程中,报告在功耗、性能与面积上同时获得提升。

原始《自然》论文引发了AI驱动电子设计自动化研究的爆发式增长。后续工作已将该方法扩展至逻辑综合、宏选择与时序优化等相邻阶段。

纽约大学坦登工程学院Siddharth Garg教授指出,AlphaChip“启发了芯片设计强化学习的全新研究方向,覆盖从逻辑综合到平面规划与时序优化的完整设计流程”。

🔬 技术澄清与最佳实践
#

《自然》附录针对社区中出现的若干混淆点进行了澄清:

  • 预训练至关重要。移除预训练会消除学习优势。DeepMind建议用户使用开源仓库在自己的模块分布上进行预训练;同时提供TPU预训练检查点作为便捷起点。
  • 计算资源扩展性。微调时应用的计算资源越多,性能越好。原始实验使用16个工作节点,每个节点配备1个GPU与32个RL环境,共享10个CPU。计算资源不足会降低质量或增加墙钟时间。
  • 初始放置。可选的启发式方法(根据物理综合种子重新平衡标准单元簇)后来被证明并非必要;消融实验显示省略该步骤对性能无显著影响。
  • 工艺节点考量。结果报告基于亚10 nm的TPU模块。较旧的学术节点(45 nm、12 nm)在拥塞与图案化特性上存在差异,奖励函数可能需要针对这些技术进行调整。
  • 作者贡献。Anna Goldie与Azalia Mirhoseini为原始《自然》论文的共同第一作者;作者顺序通过抛硬币决定。

开源仓库可完整复现已发表方法,并包含在自定义模块上进行预训练的教程。

✅ 展望:AI贯穿整个芯片设计流程
#

AlphaChip证明强化学习能够在核心物理设计任务上交付量产级结果。DeepMind预计未来版本将覆盖更多阶段——从微架构探索到制造——并最终实现硬件、软件与运行其上的机器学习模型的端到端协同优化。

更长远的愿景是形成闭环:AI设计加速下一代AI系统的芯片本身,从而为数据中心加速器、智能手机、医疗设备与边缘传感器等设备带来更快的设计周期、更高性能与更低能耗。