神经网络超参数的规范化方法:第 1 部分 —— 学习率、批量大小、动量和权重衰减
机器学习
2018-04-25 v2 计算机视觉与模式识别
神经与进化计算
机器学习
摘要
尽管在过去几年中,深度学习在图像、语音和视频处理应用中取得了令人瞩目的成功,但大多数训练使用了次优的超参数,导致训练时间不必要地过长。设置超参数仍然是一门黑魔法,需要多年的经验才能掌握。本报告提出了几种设置超参数的高效方法,可显著减少训练时间并提升性能。具体而言,本报告展示了如何检查训练验证/测试损失函数中关于欠拟合和过拟合的细微线索,并提出了向最优平衡点移动的指导原则。然后讨论了如何增加/减少学习率/动量以加快训练速度。我们的实验表明,平衡每种数据集和架构的各种正则化方式至关重要。权重衰减被用作示例正则化器,以展示其最优值如何与学习率和动量紧密耦合。提供了用于复现本文报告结果的相关文件。
引用
@article{arxiv.1803.09820,
title = {A disciplined approach to neural network hyper-parameters: Part 1 -- learning rate, batch size, momentum, and weight decay},
author = {Leslie N. Smith},
journal= {arXiv preprint arXiv:1803.09820},
year = {2018}
}
备注
Files to help replicate the results reported here are available on Github