中文

kDecay:在学习率调度中仅添加 k 衰减项以改进神经网络

机器学习 2022-03-23 v5 计算机视觉与模式识别

摘要

近期工作表明,优化学习率(LR)调度可以成为一种非常精确且高效的深度神经网络训练方式。我们观察到 LR 的变化率(ROC)与训练过程存在相关性,但如何利用这一关系来控制训练以达到提升精度的目的?我们提出了一种新方法 k-decay,仅在常用且简便的 LR 调度(exp、cosine 和 polynomial)上添加一个额外项,便有效提升了这些调度的性能,且优于 SGDR、CLR 和 AutoLRS 等最先进的 LR 调度算法。在 k-decay 中,通过调整超参数 kk 生成不同的 LR 调度,当 k 增大时,性能得到提升。我们在 CIFAR 和 ImageNet 数据集上以不同神经网络(ResNet、Wide ResNet)评估了 k-decay 方法。实验表明该方法在多数情况下均能带来提升。在 CIFAR-10 数据集上准确率提升了 1.08%,在 CIFAR-100 数据集上提升了 2.07%。在 ImageNet 上,准确率提升了 1.25%。我们的方法不仅可推广应用于其他 LR 调度,而且不产生额外计算成本。

关键词

引用

@article{arxiv.2004.05909,
  title  = {kDecay: Just adding k-decay items on Learning-Rate Schedule to improve Neural Networks},
  author = {Tao Zhang and Wei Li},
  journal= {arXiv preprint arXiv:2004.05909},
  year   = {2022}
}