重思 LLM 推理瓶颈:来自潜在注意力和混合专家的洞见
硬件体系结构
2026-01-30 v3 人工智能
摘要
构成传统 transformer 模型的计算工作负载呈现明显的二分态。多头注意力(MHA)和分组查询注意力因算术密度低而受内存限制,而前馈网络则受计算限制。这长期以来驱动了研究专业化硬件以缓解注意力瓶颈。本文认为,近期 transformer 模型架构进展——多头潜在注意力(MLA)和混合专家(MoE)——引入了新的主导瓶颈,将挑战从注意力瓶颈转移。我们提出两个关键观察:首先,MLA 的算术密度高出 MHA 两个数量级,使其趋向计算受限,适合现代加速器如 GPU。其次,在加速器池中分布式部署 MoE 专家可调节其算术密度以匹配稠密层,产生更平衡的计算配置。因此,硬件和系统优化的焦点应从注意力加速转向高带宽互连和跨加速器平衡专家工作负载。
关键词
引用
@article{arxiv.2507.15465,
title = {Rethinking LLM Inference Bottlenecks: Insights from Latent Attention and Mixture-of-Experts},
author = {Sungmin Yun and Seonyong Park and Hwayong Nam and Younjoo Lee and Gunjun Lee and Kwanhee Kyung and Sangpyo Kim and Nam Sung Kim and Jongmin Kim and Hyungyo Kim and Juhwan Cho and Seungmin Baek and Jung Ho Ahn},
journal= {arXiv preprint arXiv:2507.15465},
year = {2026}
}
备注
16 pages, 14 figures