中文

跨异构 AI 加速器的差距:揭示一致性挑战

分布式、并行与集群计算 2025-11-18 v1 人工智能 机器学习

摘要

尽管 NVIDIA 仍是云数据中心中 AI 加速器的主导供应商,但 AMD、Intel、Mac 和华为等新兴供应商提供具有兼容性和性能诉求的性价比更高的替代方案。本文首次通过实证研究调查机器学习模型在异构 AI 加速器上的差异。我们构建了一个自动化管道,合成了超过 10 万个变体模型,基于 4000 个真实世界模型,在五个不同的企业级加速器上进行执行。我们的发现表明,来自 Mac 和华为的新一代 AI 平台至少比 NVIDIA 支持 17% 更少的操作符。这些平台还表现出更高的输出偏差率(超过 5%),这些偏差源于操作符实现差异、对异常数值值的处理方式以及指令调度方式。它们也更容易在基于模型编译的加速过程中发生故障,在某些情况下,编译后的模型输出与标准执行模式生成的输出有显著差异。此外,我们识别出 PyTorch 中 7 个实现缺陷以及各供应商之间 40 个平台特定问题。这些结果凸显了在日益多样化的硬件生态系统中实现一致机器学习行为的挑战。

关键词

引用

@article{arxiv.2511.11601,
  title  = {Mind the Gap: Revealing Inconsistencies Across Heterogeneous AI Accelerators},
  author = {Elliott Wen and Sean Ma and Ewan Tempero and Jens Dietrich and Daniel Luo and Jiaxing Shen and Kaiqi Zhao and Bruce Sham and Yousong Song and Jiayi Hua and Jia Hong},
  journal= {arXiv preprint arXiv:2511.11601},
  year   = {2025}
}