中文

CProp:基于历史梯度一致性的自适应学习率缩放

机器学习 2019-12-30 v1 机器学习

摘要

包括随机梯度下降(SGD)及其自适应梯度变体在内的大多数优化器都面临同一问题:训练过程中的有效学习率差异巨大。实践中通常采用主要由手工调节的学习率调度。本文提出 CProp,一种梯度缩放方法,它作为二级学习率,基于历史梯度一致性的线索在整个训练过程中自适应调整。当历史梯度方向一致时,CProp 保持原始学习率;反之,若梯度方向不一致,CProp 按其不确定性比例缩小梯度。由于通过缩放起作用,它可应用于任何现有优化器以扩展其学习率调度能力。我们将 CProp 进行一系列测试,在 SGD 与 Adam 等自适应梯度方法上均显示出训练速度的显著提升。代码见 https://github.com/phizaz/cprop 。

关键词

引用

@article{arxiv.1912.11493,
  title  = {CProp: Adaptive Learning Rate Scaling from Past Gradient Conformity},
  author = {Konpat Preechakul and Boonserm Kijsirikul},
  journal= {arXiv preprint arXiv:1912.11493},
  year   = {2019}
}