梯度梳理:通过雅可比矩阵的动态控制改进梯度下降
机器学习
2024-01-01 v1 人工智能
混沌动力学
神经元与认知
机器学习
摘要
训练循环神经网络(RNN)仍然是一个挑战,因为梯度在长时间跨度内不稳定,可能导致梯度爆炸和消失。最近的研究将这些与正向动力学的李雅普诺夫指数值联系起来,这些指数描述了无穷小扰动的增长或收缩。在这里,我们提出了梯度梳理,一种通过在训练过程中将正向动力学的李雅普诺夫指数推向零来解决梯度不稳定性的新方法。我们通过使用可微线性代数通过反向传播正则化李雅普诺夫指数来实现这一点。这使我们能够“梳理”梯度,稳定它们,从而改进网络训练。我们证明梯度梳理不仅控制梯度范数,还控制长期雅可比矩阵的条件数,促进多维误差反馈传播。我们发现,在训练前应用梯度梳理可以提高涉及长时间跨度任务的成功率和收敛速度。对于具有挑战性的任务,我们表明训练期间的梯度梳理可以进一步增加通过时间反向传播可以桥接的时间跨度。此外,我们在各种RNN架构和不同时间复杂度的任务上展示了我们方法的有效性。此外,我们提供了梯度梳理算法的简单实现,可在实践中使用。我们的结果表明,通过正则化李雅普诺夫指数进行梯度梳理可以显著提高RNN训练的有效性,并缓解梯度爆炸和消失问题。
引用
@article{arxiv.2312.17306,
title = {Gradient Flossing: Improving Gradient Descent through Dynamic Control of Jacobians},
author = {Rainer Engelken},
journal= {arXiv preprint arXiv:2312.17306},
year = {2024}
}
备注
28 pages, 16 figures, accepted at NeurIPS 2023