REX:以改进调度重新审视预算化训练
机器学习
2021-07-12 v1
摘要
深度学习从业者常在计算与资金预算下运作。因此,设计在任何预算下均表现良好的优化算法至关重要。线性学习率调度被视为最佳的预算感知调度,因其在低预算情形下优于大多数其他调度。另一方面,诸如 30-60-90 步调度等学习率调度在模型可训练多轮时已知能达到高性能。然而,预算大小往往无法事先知晓;因此,学习率调度的最优选择需逐案而定。本文将学习率调度选择问题构建为 i) 选择轮廓(即建模学习率调度的连续函数)与 ii) 选择采样率(即从该轮廓更新/采样学习率的频率)的组合。我们提出了一种称为反射指数(REX)调度的新轮廓与采样率组合,并在七种不同实验设置下使用 SGD 与 Adam 优化器进行评估。REX 在低预算情形下优于线性调度,同时在高低预算情形下匹配或超过多种最先进学习率调度(线性、步长、指数、余弦、平台步衰减与 OneCycle)的性能。此外,REX 无需额外计算、存储或超参数。
引用
@article{arxiv.2107.04197,
title = {REX: Revisiting Budgeted Training with an Improved Schedule},
author = {John Chen and Cameron Wolfe and Anastasios Kyrillidis},
journal= {arXiv preprint arXiv:2107.04197},
year = {2021}
}