关于神经网络训练中的离散化漂移与平滑性正则化
机器学习
2023-10-24 v1 机器学习
摘要
将现实世界问题转化为数学优化,并通过使用基于梯度的优化训练深度神经网络来解决优化问题的深度学习方案,无疑已被证明是富有成效的。然而,关于深度学习为何有效的理解一直滞后于其实际意义。我们旨在朝着改进对深度学习的理解迈出步伐,重点关注优化与模型正则化。我们首先研究梯度下降(GD),这是一种离散时间算法,是大多数流行深度学习优化算法的基础。理解 GD 的动态一直受到离散化漂移的阻碍,即 GD 与其常被研究的连续时间对应物——负梯度流(NGF)——之间的数值积分误差。为了扩充可用于研究 GD 的工具箱,我们推导了考虑离散化漂移的新连续时间流。与 NGF 不同,这些新流可用于描述 GD 的特定学习率行为,例如监督学习和双人博弈中观察到的训练不稳定性。然后,我们通过构建不需要额外超参数的新型学习率调度和正则化器,将连续时间的见解转化为针对不稳定 GD 动态的缓解策略。与优化一样,平滑性正则化是深度学习成功的另一支柱,在监督学习和生成建模中广泛使用。尽管它们各自具有重要意义,但平滑性正则化与优化之间的相互作用尚待探索。我们发现平滑性正则化在多个深度学习领域影响优化,并且将平滑性正则化纳入强化学习可带来性能提升,而这种提升可通过优化方法的调整来恢复。
引用
@article{arxiv.2310.14036,
title = {On discretisation drift and smoothness regularisation in neural network training},
author = {Mihaela Claudia Rosca},
journal= {arXiv preprint arXiv:2310.14036},
year = {2023}
}
备注
PhD thesis. arXiv admin note: text overlap with arXiv:2302.01952