中文

使用随机学习率的训练

机器学习 2019-01-30 v3 神经与进化计算 机器学习

摘要

超参数调优是深度学习模型训练中的一个烦人步骤。最敏感的超参数之一是梯度下降的学习率。我们提出了用于神经网络的“一次性全学习率”(Alrao)优化方法:网络中的每个单元或特征都获得其自身的学习率,该学习率从跨越数个数量级的随机分布中采样。这在计算上几乎不带来额外成本。或许令人惊讶的是,对于各种架构和问题,使用 Alrao 的随机梯度下降(SGD)性能接近于使用最优调优学习率的 SGD。Alrao 可在测试深度学习模型时节省时间:可用 Alrao 快速评估一系列模型,然后对最有前景的模型进行更充分的训练。本文附带该方法的 PyTorch 实现,可插入现有 PyTorch 模型:https://github.com/leonardblier/alrao。

关键词

引用

@article{arxiv.1810.01322,
  title  = {Learning with Random Learning Rates},
  author = {Léonard Blier and Pierre Wolinski and Yann Ollivier},
  journal= {arXiv preprint arXiv:1810.01322},
  year   = {2019}
}

备注

20 pages, 8 figures, code available on GitHub