扩展学习优化器是否值得?评估 VeLO 的 4000 TPU 月的价值
机器学习
2024-03-08 v2 人工智能
最优化与控制
摘要
我们分析了 VeLO(通用学习优化器),这是迄今为止最大规模训练通用“基础”优化器的尝试。VeLO 在数千个机器学习任务上使用超过 4000 TPU 月进行训练,旨在产生一种能够泛化到新问题、无需超参数且优于 Adam 等行业标准的优化器。我们在 MLCommons 优化器基准套件上独立评估 VeLO。我们发现,与最初的主张相反:(1)VeLO 有一个需要针对特定问题调优的关键超参数,(2)VeLO 不一定在找到的解的质量上优于竞争对手,以及(3)VeLO 在降低训练损失方面并不比竞争优化器更快。这些观察结果对 VeLO 的通用性以及训练它所投入资源的价值提出了质疑。
引用
@article{arxiv.2310.18191,
title = {Is Scaling Learned Optimizers Worth It? Evaluating The Value of VeLO's 4000 TPU Months},
author = {Fady Rezk and Antreas Antoniou and Henry Gouk and Timothy Hospedales},
journal= {arXiv preprint arXiv:2310.18191},
year = {2024}
}