通过设计保证梯度不消失的哈密顿深度神经网络
机器学习
2023-01-02 v2 系统与控制
系统与控制
摘要
深度神经网络(DNNs)的训练可能较为困难,因为在通过反向传播进行权重优化时会出现梯度消失和梯度爆炸现象。为解决此问题,我们提出一类通用的哈密顿深度神经网络(H-DNNs),其源于连续时间哈密顿系统的离散化,并包含了若干现有的基于常微分方程的DNN架构。我们的主要结果是,一大类H-DNNs通过设计即可对任意网络深度保证梯度不消失。这是通过证明在使用半隐式欧拉离散化方案时,梯度计算中所涉及的反向敏感度矩阵为辛矩阵而得到的。我们还给出了敏感度矩阵大小的上界,并表明可通过正则化控制梯度爆炸。最后,我们通过刻画权重矩阵上适当的稀疏性约束,实现了H-DNNs中反向和正向传播算法的分布式执行。H-DNNs的良好性能在基准分类问题上得到了验证,包括使用MNIST数据集的图像分类。
引用
@article{arxiv.2105.13205,
title = {Hamiltonian Deep Neural Networks Guaranteeing Non-vanishing Gradients by Design},
author = {Clara Lucía Galimberti and Luca Furieri and Liang Xu and Giancarlo Ferrari-Trecate},
journal= {arXiv preprint arXiv:2105.13205},
year = {2023}
}