学习与动量的黄金比例
机器学习
2020-06-09 v1 神经与进化计算
机器学习
摘要
从早期到当今的深度学习网络,梯度下降一直是人工神经网络的核心训练原则。最常见的实现是用于以监督方式训练前馈神经网络的反向传播算法。反向传播涉及计算损失函数相对于网络权重的梯度,以更新权重从而最小化损失。尽管均方误差常被用作损失函数,但通用随机梯度下降原则并未直接与特定损失函数相关联。反向传播的另一个缺陷是寻找两个重要训练参数(学习率和动量权重)的最优值,在大多数系统中它们是通过经验确定的。学习率指定了沿梯度朝向损失函数最小值时的步长,而动量权重在更新当前权重时考虑先前的权重变化。将这两个参数结合使用被普遍认为是改善训练的一种手段,尽管它们的具体取值并不能直接从标准反向传播理论中得出。本文受突触中神经信号处理的启发,提出了一种新的信息论损失函数。该新损失函数隐含了特定的学习率和动量权重,对应于实践中常用的经验参数。所提出的框架还对动量项及其对训练过程的平滑效应提供了更形式化的解释。综合所有结果表明,损失、学习率和动量密切相关。为支持这些理论发现,针对手写数字识别的实验显示了所提损失函数和训练参数的实际效用。
引用
@article{arxiv.2006.04751,
title = {The Golden Ratio of Learning and Momentum},
author = {Stefan Jaeger},
journal= {arXiv preprint arXiv:2006.04751},
year = {2020}
}
备注
10 pages, 3 figures, under review