随机正交加性滤波器:深度神经网络梯度消失/爆炸问题的一种解决方案
机器学习
2022-10-05 v1 人工智能
数值分析
动力系统
数值分析
摘要
自九十年代初认识到困扰神经网络(NNs)训练的方差/爆炸(V/E)梯度问题以来,人们已付出巨大努力以克服该障碍。然而,迄今针对 V/E 问题的清晰解决方案仍难以捉摸。本手稿提出一种新型 NN 架构,旨在从数学上防止 V/E 问题发生。对近似动态等距(即输入-输出雅可比矩阵奇异值紧密分布于 1 附近的参数配置)的追求,引出了一种与流行残差网络模型具有共同特征的 NN 架构。其思想不是层间跳跃连接,而是正交滤波先前的激活并将其加至下一层的非线性激活,实现二者间的凸组合。值得注意的是,梯度更新不可能消失或爆炸被解析界限所证明,该界限即使在无限深度情形也成立。本方法的有效性通过反向传播训练一个 5 万层的极深多层感知机,以及一个用于学习输入中过去 1 万时间步长期依赖的 Elman NN 得到实证。相较于其他专门应对 V/E 问题的架构(如用于循环 NNs 的 LSTMs),所提模型更简单却更有效。令人惊讶的是,单层 vanilla RNN 可被增强至达到最先进性能,同时超快收敛;例如在 psMNIST 任务上,首轮即可获超 94% 测试准确率,仅 10 轮后超 98%。
引用
@article{arxiv.2210.01245,
title = {Random orthogonal additive filters: a solution to the vanishing/exploding gradient of deep neural networks},
author = {Andrea Ceni},
journal= {arXiv preprint arXiv:2210.01245},
year = {2022}
}