中文

一种用于训练循环神经网络的增广拉格朗日方法

最优化与控制 2024-08-20 v2

摘要

循环神经网络(RNNs)被广泛用于对自然语言处理、语音识别、机器翻译和时间序列分析等广泛领域的序列数据进行建模。在本文中,我们将使用 ReLU 激活函数的 RNNs 训练过程建模为一个约束优化问题,其具有光滑非凸目标函数和分段光滑非凸约束。我们证明该优化问题的任意可行点均满足无非零异常乘子约束规格(NNAMCQ),且任意局部极小值点均为该问题的 Karush-Kuhn-Tucker(KKT)点。此外,我们提出了一种增广拉格朗日方法(ALM),并设计了一种高效的块坐标下降(BCD)方法来求解 ALM 的子问题。BCD 方法中每个块的更新均具有闭式解。内循环的停止准则易于验证,且可在有限步内停止。此外,我们证明 BCD 方法能够生成子问题的方向稳定点。进一步地,我们建立了 ALM 向该约束优化问题的 KKT 点的全局收敛性。与现有算法相比,数值结果证明了 ALM 在训练 RNNs 方面的高效性与有效性。

关键词

引用

@article{arxiv.2402.13687,
  title  = {An Augmented Lagrangian Method for Training Recurrent Neural Networks},
  author = {Yue Wang and Chao Zhang and Xiaojun Chen},
  journal= {arXiv preprint arXiv:2402.13687},
  year   = {2024}
}

备注

30 pages