通过预训练稳定 RNN 梯度
机器学习
2024-01-08 v2 人工智能
摘要
众多学习理论提出防止梯度随深度或时间呈指数增长,以稳定并改善训练。鉴于数学可处理性,这些分析通常在前馈全连接神经网络或简单单层循环神经网络上进行。相比之下,本研究表明,当架构过于复杂而无法进行解析初始化时,将网络预训练至局部稳定是有效的。此外,我们将已知的稳定性理论扩展至涵盖更广类的深度循环网络,仅需对数据与参数分布作极小假设,我们将该理论称为局部稳定性条件(Local Stability Condition, LSC)。我们的研究发现,经典的 Glorot、He 和正交初始化方案应用于前馈全连接神经网络时满足 LSC。然而,在分析深度循环网络时,我们识别出一种新的加性指数爆炸源,它来自深度与时间构成的矩形网格中梯度路径的计数。我们提出一种缓解该问题的新方法,即赋予时间与深度对梯度的贡献以权重二分之一,而非经典权重一。我们的实证结果证实,将前馈与循环网络(包括可微、神经形态与状态空间模型)预训练至满足 LSC,常能带来更优的最终性能。本研究通过提供一种稳定任意复杂度网络的手段为该领域作出贡献。我们的方法可作为在大规模增广数据集上预训练之前的额外步骤实现,并作为解析寻找稳定初始化的替代方案。
引用
@article{arxiv.2308.12075,
title = {Stabilizing RNN Gradients through Pre-training},
author = {Luca Herranz-Celotti and Jean Rouat},
journal= {arXiv preprint arXiv:2308.12075},
year = {2024}
}