中文

神经网络超参数的规范化方法:第 1 部分 —— 学习率、批量大小、动量和权重衰减

机器学习 2018-04-25 v2 计算机视觉与模式识别 神经与进化计算 机器学习

摘要

尽管在过去几年中,深度学习在图像、语音和视频处理应用中取得了令人瞩目的成功,但大多数训练使用了次优的超参数,导致训练时间不必要地过长。设置超参数仍然是一门黑魔法,需要多年的经验才能掌握。本报告提出了几种设置超参数的高效方法,可显著减少训练时间并提升性能。具体而言,本报告展示了如何检查训练验证/测试损失函数中关于欠拟合和过拟合的细微线索,并提出了向最优平衡点移动的指导原则。然后讨论了如何增加/减少学习率/动量以加快训练速度。我们的实验表明,平衡每种数据集和架构的各种正则化方式至关重要。权重衰减被用作示例正则化器,以展示其最优值如何与学习率和动量紧密耦合。提供了用于复现本文报告结果的相关文件。

关键词

引用

@article{arxiv.1803.09820,
  title  = {A disciplined approach to neural network hyper-parameters: Part 1 -- learning rate, batch size, momentum, and weight decay},
  author = {Leslie N. Smith},
  journal= {arXiv preprint arXiv:1803.09820},
  year   = {2018}
}

备注

Files to help replicate the results reported here are available on Github