较少调度的道路
机器学习
2024-10-31 v4 人工智能
最优化与控制
机器学习
摘要
现有的学习率计划在不要求指定优化停止步骤 T 的情况下,与依赖于 T 的学习率计划相比表现大幌下降。我们提出一种方法,避免了这种停止时间的需求,同时在广泛的一系列问题上(从凸问题到大规模深度学习问题)均表现出领先于计划的性能。我们的无计划方法在标准带动量优化器之上没有引入额外的超参数。我们的方法是我们发展的新理论的一个直接结果,这一理论统一了调度和迭代平均。我们提供的开源实现可在 https://github.com/facebookresearch/schedule_free 获取。无计划 AdamW 是我们在 MLCommons 2024 AlgoPerf 算法效率挑战中 Self-Tuning 轨道中获胜条目的核心算法。
引用
@article{arxiv.2405.15682,
title = {The Road Less Scheduled},
author = {Aaron Defazio and Xingyu Alice Yang and Harsh Mehta and Konstantin Mishchenko and Ahmed Khaled and Ashok Cutkosky},
journal= {arXiv preprint arXiv:2405.15682},
year = {2024}
}