效率竞赛:AI扩展定律的新视角
机器学习
2025-01-09 v3 人工智能
性能
摘要
随着大规模AI模型的扩展,训练成本越来越高,维持进展也越来越困难。经典扩展定律(例如Kaplan等人(2020),Hoffmann等人(2022))从静态计算预算预测训练损失,但忽略了时间和效率,从而引发了一个问题:我们如何在不断膨胀的GPU集群与快速改进的硬件和算法之间取得平衡?我们引入了相对损失方程,这是一个具有时间和效率意识的框架,扩展了经典的AI扩展定律。我们的模型表明,如果没有持续的效率提升,高级性能可能需要数千年的训练或不切实际的大型GPU集群。然而,如果“效率翻倍率”与摩尔定律相当,则仍可实现接近指数级的进展。通过形式化这场效率竞赛,我们提供了一个定量路线图,用于平衡前期GPU投资与AI堆栈各层的增量改进。经验趋势表明,持续的效率提升可以将AI扩展推进到未来十年,为经典扩展定律中固有的收益递减提供了新视角。
引用
@article{arxiv.2501.02156,
title = {The Race to Efficiency: A New Perspective on AI Scaling Laws},
author = {Chien-Ping Lu},
journal= {arXiv preprint arXiv:2501.02156},
year = {2025}
}
备注
21 pages, 3 figures. 2 tables, second draft