xPU-athalon:量化 AI 加速器的竞争格局
硬件体系结构
2026-04-14 v1
摘要
AI 计算效率的推进趋势催生了各种加速器架构,这些架构日益挑战 GPU 长期主导的地位。本文提供了这一演进中脉动加速器生态的量化视角,包括 Cerebras CS-3、SambaNova SN-40、Groq、Gaudi 和 TPUv5e 平台,并与 NVIDIA(A100、H100)和 AMD(MI-300X)GPU 进行比较。我们评估了在端到端工作负载和单个计算基元基准测试中的延迟、吞吐量、功耗和能源效率等关键权衡。值得注意的是,最佳硬件平台会因 batch size、序列长度和模型大小的不同而有所变化,揭示了巨大的潜在优化空间。我们的分析包括对 LLM 推理中 prefill 和 decode 阶段的详细功耗测量,以及通信能源成本的量化。此外,我们发现 Cerebras、SambaNova 和 Gaudi 的空闲功耗比 NVIDIA 和 AMD GPU 高出 10%-60%,强调了在实现承诺效率收益的同时保持高利用率的重要性。最后,我们根据在真实剖析工作负载上的实验,评估了各平台的可编程性,比较了编译时间和软件堆栈成熟度,以实现承诺的性能。
引用
@article{arxiv.2604.10852,
title = {The xPU-athalon: Quantifying the Competition of AI Acceleration},
author = {Alicia Golden and Carole-Jean Wu and Gu-Yeon Wei and David Brooks},
journal= {arXiv preprint arXiv:2604.10852},
year = {2026}
}
备注
Accepted to ISPASS 2026