用于非凸随机优化的随机 Anderson 混合
机器学习
2021-10-05 v1 最优化与控制
摘要
Anderson 混合(AM)是一种用于不动点迭代的加速方法。尽管其在科学计算中取得成功且被广泛使用,AM 的收敛理论仍不清楚,且其在机器学习问题中的应用尚未充分探索。本文通过引入阻尼投影与自适应正则化到经典 AM,提出一种随机 Anderson 混合(SAM)方案以求解非凸随机优化问题。在温和假设下,我们建立了 SAM 的收敛理论,包括到驻点的几乎必然收敛及最坏情况迭代复杂度。此外,当随机选取一迭代点作为输出时,复杂度界可改进。为进一步加速收敛,我们将方差缩减技术纳入所提 SAM。我们还提出一种 SAM 的预条件混合策略,其可在经验上实现更快收敛或更好泛化能力。最后,我们将 SAM 方法应用于训练多种神经网络,包括普通 CNN、ResNets、WideResNet、ResNeXt、DenseNet 与 RNN。在图像分类与语言模型上的实验结果展示了我们方法的优势。
引用
@article{arxiv.2110.01543,
title = {Stochastic Anderson Mixing for Nonconvex Stochastic Optimization},
author = {Fuchao Wei and Chenglong Bao and Yang Liu},
journal= {arXiv preprint arXiv:2110.01543},
year = {2021}
}
备注
Accepted by the 35th Conference on Neural Information Processing Systems (NeurIPS 2021)