中文

探索 3D 堆叠 AI 芯片架构在 LLM 推理中的效率——基于 Voxel 的研究

硬件体系结构 2026-04-30 v1 分布式、并行与集群计算

摘要

为克服 AI 芯片中广为人知的存储瓶颈,3D 堆叠架构采用高密度通孔(TSV)引脚的先进封装技术被证明是有前景的解决方案。3D 堆叠 AI 芯片通过在计算单元上方堆叠大量 DRAM 银行,实现了 ultra-high 的计算与存储之间的带宽。然而,由于其独特的分布式特性,探索 3D 堆叠 AI 芯片的效率并不容易。需要仔细考虑从上层计算范式到机器学习编译器优化,再到底层硬件架构的诸多相互交织因素。本文开发了 Voxel,一个快速且编译感知的端到端仿真框架,以便于探索 3D 堆叠 AI 芯片用于大语言模型(LLM)推理的效率。Voxel 通过一种编程接口,允许 ML 编译器自定义模型执行计划,从而实现软件/硬件协同探索。经过在真实硅片上仿真器验证后,我们全面检验了 3D 堆叠 AI 芯片各方面的影响与相关性,包括最先进的计算范式、瓦片到计算单元的映射、张量到银行的映射、NoC 拓扑结构和链路带宽、DRAM 银行带宽、每个计算单元的 SRAM 容量以及能耗/热约束。我们的发现揭示,3D 堆叠 AI 芯片的端到端效率不仅由这些因素的协同作用决定,也显著取决于瓦片到 AI 计算单元和 DRAM 银行的映射。我们在全文中报告了这些发现,期望它们为 3D 堆叠 AI 芯片生态系统的发展提供指引。我们将开源 Voxel 及我们的研究结果供公众研究使用。

关键词

引用

@article{arxiv.2604.26821,
  title  = {Exploring the Efficiency of 3D-Stacked AI Chip Architecture for LLM Inference with Voxel},
  author = {Yiqi Liu and Noelle Crawford and Michael Wang and Jilong Xue and Jian Huang},
  journal= {arXiv preprint arXiv:2604.26821},
  year   = {2026}
}