面向 LLM 推理的热感知 3D 堆叠架构设计与带宽共享
硬件体系结构
2025-11-20 v3
摘要
LLM 的自回归解码是推理中的主要瓶颈,due to 内存密集型运算和有限的硬件带宽。3D 堆叠架构是一种具有显著改进内存带宽的有前景的解决方案,即将多颗 DRAM 芯片垂直堆叠在逻辑芯片上。然而,我们的实验也表明,3D 堆叠架构在热力学方面面临更严重的问题,包括热温度、梯度和可扩展性。为更好地发挥 3D 堆叠架构的潜力,我们提出 Tasa,一种具有跨堆热优化的异构架构,以平衡温度分布并在热约束下最大化性能。高性能核心用于计算密集型运算,而高效率核心用于内存密集型算子,例如注意力层。此外,我们提出一种带宽共享调度,以提高此类异构架构的带宽利用率。广泛的热力学实验表明,我们的 Tasa 架构相对于均匀 3D 堆叠架构具有更好的可扩展性,即在 48、60 和 72 核配置下分别实现约 5.55℃、9.37℃ 和 7.91℃ 的峰值温度降低。我们的 Llama-65B 和 GPT-3 66B 推理实验也表明,相对于 GPU 基线和最先进的异构 PIM 类 LLM 加速器,分别实现了 2.85 倍和 2.21 倍的加速。
引用
@article{arxiv.2508.07252,
title = {Tasa: Thermal-aware 3D-Stacked Architecture Design with Bandwidth Sharing for LLM Inference},
author = {Siyuan He and Peiran Yan and Yandong He and Youwei Zhuo and Tianyu Jia},
journal= {arXiv preprint arXiv:2508.07252},
year = {2025}
}