中文

加速神经网络训练:AlgoPerf 竞赛分析

机器学习 2025-02-24 v1 机器学习

摘要

AlgoPerf: Training Algorithms 竞赛的目标是评估仅通过改进底层训练算法所实现的神经网络训练实际加速效果。在外部调参规则集中,提交方案必须提供与工作负载无关的超参数搜索空间;而在自调参规则集中,它们必须完全无超参数。在两种规则集下,提交方案均在固定硬件上训练多个深度学习工作负载,并以结果达成时间进行比较。本文呈现了首届 AlgoPerf 竞赛的结果,该竞赛吸引了来自 10 个团队的 18 份多样化提交。我们的调查揭示了几个关键发现:(1)外部调参规则集的获胜方案使用 Distributed Shampoo,证明了非对角预条件方法相较于 Adam 等流行方法的有效性,即使在挂钟运行时间上进行比较也是如此。(2)自调参规则集的获胜方案基于 Schedule Free AdamW 算法,展示了完全无超参数训练算法的新效能水平。(3)得分最高的提交方案对工作负载变化表现出惊人的鲁棒性。我们还讨论了在确保不同训练算法公平比较时遇到的工程挑战。这些结果既凸显了迄今取得的显著进展,也表明了仍有相当大的改进空间。

关键词

引用

@article{arxiv.2502.15015,
  title  = {Accelerating Neural Network Training: An Analysis of the AlgoPerf Competition},
  author = {Priya Kasimbeg and Frank Schneider and Runa Eschenhagen and Juhan Bae and Chandramouli Shama Sastry and Mark Saroufim and Boyuan Feng and Less Wright and Edward Z. Yang and Zachary Nado and Sourabh Medapati and Philipp Hennig and Michael Rabbat and George E. Dahl},
  journal= {arXiv preprint arXiv:2502.15015},
  year   = {2025}
}

备注

ICLR 2025; 23 pages, 5 figures, 8 tables