同时训练,更好泛化:基于梯度的极小极大学习器的稳定性
机器学习
2020-10-26 v1 最优化与控制
机器学习
摘要
生成对抗网络(GANs)的极小极大学习问题的成功已被观察到依赖于用于其训练的极小极大优化算法。这种依赖性通常归因于底层优化算法的收敛速度与鲁棒性性质。在本文中,我们表明优化算法在训练所得极小极大模型的泛化性能中也起关键作用。为此,我们通过算法稳定性的视角,在凸凹与非凸非凹极小极大设定下分析标准梯度下降上升(GDA)与邻近点方法(PPM)算法的泛化性质。虽然 GDA 算法在凸凹问题中不能保证具有消失的超额风险,我们证明 PPM 算法在同一设定下享有有界的超额风险。对于非凸非凹问题,我们比较随机 GDA 与 GDmax 算法的泛化性能,后者在每次迭代完全求解最大化子问题。我们的泛化分析表明,只要最小化与最大化子问题以相似学习率同时求解,GDA 就具有优越性。我们讨论了若干数值结果,表明优化算法在所学极小极大模型泛化中的作用。
引用
@article{arxiv.2010.12561,
title = {Train simultaneously, generalize better: Stability of gradient-based minimax learners},
author = {Farzan Farnia and Asuman Ozdaglar},
journal= {arXiv preprint arXiv:2010.12561},
year = {2020}
}