中文

较少调度的道路

机器学习 2024-10-31 v4 人工智能 最优化与控制 机器学习

摘要

现有的学习率计划在不要求指定优化停止步骤 T 的情况下,与依赖于 T 的学习率计划相比表现大幌下降。我们提出一种方法,避免了这种停止时间的需求,同时在广泛的一系列问题上(从凸问题到大规模深度学习问题)均表现出领先于计划的性能。我们的无计划方法在标准带动量优化器之上没有引入额外的超参数。我们的方法是我们发展的新理论的一个直接结果,这一理论统一了调度和迭代平均。我们提供的开源实现可在 https://github.com/facebookresearch/schedule_free 获取。无计划 AdamW 是我们在 MLCommons 2024 AlgoPerf 算法效率挑战中 Self-Tuning 轨道中获胜条目的核心算法。

关键词

引用

@article{arxiv.2405.15682,
  title  = {The Road Less Scheduled},
  author = {Aaron Defazio and Xingyu Alice Yang and Harsh Mehta and Konstantin Mishchenko and Ahmed Khaled and Ashok Cutkosky},
  journal= {arXiv preprint arXiv:2405.15682},
  year   = {2024}
}