深度神经网络运动方程探析:连续时间梯度下降与离散化误差分析
机器学习
2023-02-28 v2 机器学习
摘要
我们推导并求解深度神经网络 (DNNs) 的“运动方程” (EoM),这是一个精确描述 DNN 离散学习动力学的微分方程。微分方程虽是连续的,但即使在离散优化(梯度下降 (GD) 算法)研究中也发挥了重要作用。然而,由于离散化误差,微分方程与 DNN 实际学习动力学之间仍存在鸿沟。本文从梯度流 (GF) 出发,推导一个抵消 GF 与 GD 间离散化误差的反项。据此我们得到 EoM,一个精确描述 GD 离散学习动力学的连续微分方程。我们还推导离散化误差以表明 EoM 的精确程度。此外,我们将 EoM 应用于两种特例:尺度不变与平移不变层。EoM 凸显了连续时间与离散时间 GD 的差异,表明反项对于更好描述 GD 离散学习动力学的重要性。我们的实验结果支持了理论发现。
引用
@article{arxiv.2210.15898,
title = {Toward Equation of Motion for Deep Neural Networks: Continuous-time Gradient Descent and Discretization Error Analysis},
author = {Taiki Miyagawa},
journal= {arXiv preprint arXiv:2210.15898},
year = {2023}
}
备注
NeurIPS 2022 (https://openreview.net/forum?id=qq84D17BPu). 1 min & 4 mins short presentation videos are available; feel free to email me :)