中文

面向大语言模型推理的 AI 加速器:架构分析与扩展策略

硬件体系结构 2025-06-10 v1 机器学习

摘要

大语言模型 (LLM) 的快速增长正推动新一波用于推理的专用硬件。本文提出了首个以工作负载为中心、跨架构的商业 AI 加速器性能研究,涵盖基于 GPU 的芯片、混合封装和晶圆级引擎。我们比较了内存层次结构、计算架构和片上互连,并观察到随着批大小和序列长度的变化,不同架构间的性能差异高达 3.7 倍。本文研究了万亿参数模型的四种扩展技术;专家并行提供了 8.4 倍的参数计算比优势,但其延迟方差比张量并行高 2.1 倍。这些发现为工作负载与加速器的匹配提供了定量指导,并揭示了下一代设计必须解决的架构差距。

关键词

引用

@article{arxiv.2506.00008,
  title  = {AI Accelerators for Large Language Model Inference: Architecture Analysis and Scaling Strategies},
  author = {Amit Sharma},
  journal= {arXiv preprint arXiv:2506.00008},
  year   = {2025}
}