P-ADMMiRNN:通过高效并行 ADMM 方法实现稳定收敛的 RNN 训练
机器学习
2022-03-29 v3 机器学习
摘要
由于循环单元中的权重在迭代间重复,难以稳定收敛地训练循环神经网络(RNN),且难以避免梯度消失与爆炸问题。此外,RNN 对权重与偏置的初始化敏感,给训练带来困难。交替方向乘子法(ADMM)凭借无梯度特性及对不良条件的免疫性,已成为超越传统随机梯度算法训练神经网络的一种有前景的算法。然而,由于循环单元中的状态随时间步反复更新,ADMM 无法直接用于训练 RNN。因此,本工作在 RNN 展开形式之上构建名为 ADMMiRNN 的新框架,以同时应对上述挑战。我们还给出了新颖的更新规则与理论收敛分析。我们通过构造的近似技术及各子问题的解,明确指定了 ADMMiRNN 迭代中的基本更新规则,而非采用朴素 ADMM。数值实验在 MNIST、IMDb 及文本分类任务上进行。ADMMiRNN 取得了收敛结果并优于对比基线。此外,与随机梯度算法相比,ADMMiRNN 训练 RNN 更稳定,无梯度消失或爆炸。我们还提供了关于 ADMMiRNN 的分布式并行算法,名为 P-ADMMiRNN,包括同步并行 ADMMiRNN(SP-ADMMiRNN)与异步并行 ADMMiRNN(AP-ADMMiRNN),首次以异步并行方式用 ADMM 训练 RNN。源代码已公开可用。
引用
@article{arxiv.2006.05622,
title = {P-ADMMiRNN: Training RNN with Stable Convergence via An Efficient and Paralleled ADMM Approach},
author = {Yu Tang and Zhigang Kan and Dequan Sun and Jingjing Xiao and Zhiquan Lai and Linbo Qiao and Dongsheng Li},
journal= {arXiv preprint arXiv:2006.05622},
year = {2022}
}
备注
13 pages, 12 figures