中文

用于训练结构化神经网络的高效非精确子问题求解器正则化自适应动量对偶平均算法

机器学习 2024-12-30 v2 最优化与控制

摘要

我们提出了一种用于训练结构化神经网络的正则化自适应动量对偶平均(RAMDA)算法。与现有的正则化自适应方法类似,计算 RAMDA 更新方向的子问题涉及非光滑正则化项和对角预条件子,因此通常没有闭式解。为此,我们还精心设计了一个可实现的非精确性条件,该条件保留了与精确版本类似的收敛保证,并为 RAMDA 及现有方法的子问题提出了一个伴随的高效求解器,使其在实际中可行。我们利用变分分析中的流形识别理论证明,即使存在这种非精确性,RAMDA 的迭代在渐近收敛的稳定点处也能获得由正则化项诱导的理想结构。该结构在收敛点附近是局部最优的,因此 RAMDA 保证在所有收敛到同一点的方法中获得可能的最佳结构,使其成为第一个输出具有出色预测性能且(局部)最优结构化模型的正则化自适应方法。在大规模现代计算机视觉、语言建模和语音任务中的大量数值实验表明,所提出的 RAMDA 是高效的,并且在训练结构化神经网络方面始终优于现有最优方法。我们的算法实现可在 https://www.github.com/ismoptgroup/RAMDA/ 获取。

关键词

引用

@article{arxiv.2403.14398,
  title  = {Regularized Adaptive Momentum Dual Averaging with an Efficient Inexact Subproblem Solver for Training Structured Neural Network},
  author = {Zih-Syuan Huang and Ching-pei Lee},
  journal= {arXiv preprint arXiv:2403.14398},
  year   = {2024}
}

备注

NeurIPS 2024. 25 pages