中文

基于 Frank-Wolfe 算法沿局部最优轨迹训练 RNN

机器学习 2020-10-16 v3 计算机视觉与模式识别

摘要

我们提出了一种新颖高效的 RNN 训练方法:在外层循环中,于损失曲面上的小区域内迭代寻找局部极小点,并利用该方向向量进行更新。我们提出在此背景下使用 Frank-Wolfe (FW) 算法。尽管 FW 隐式地涉及归一化梯度,可能导致收敛速度缓慢,我们仍开发了一种新颖的 RNN 训练方法,令人惊讶的是,即便存在额外开销,经验观察表明其总体训练代价低于反向传播。我们的方法导出了一种新的 Frank-Wolfe 方法,本质上是一种带重启机制的 SGD 算法。我们证明在特定条件下,我们的算法对 ϵ\epsilon 误差具有 O(1/ϵ)O(1/\epsilon) 的亚线性收敛率。随后我们在多个基准数据集(包括展现长程依赖的数据集)上进行实验,显示出显著的性能提升。我们还在深度 RNN 架构上实验并展示了高效的训练性能。最后,我们证明了我们的训练方法对噪声数据具有鲁棒性。

关键词

引用

@article{arxiv.2010.05397,
  title  = {RNN Training along Locally Optimal Trajectories via Frank-Wolfe Algorithm},
  author = {Yun Yue and Ming Li and Venkatesh Saligrama and Ziming Zhang},
  journal= {arXiv preprint arXiv:2010.05397},
  year   = {2020}
}