理解生成对抗网络中的过参数化
机器学习
2021-04-13 v1 机器学习
摘要
一类广泛的无人监督深度学习方法,如生成对抗网络(GANs),涉及过参数化模型的训练,其中模型参数数量超过某一阈值。监督学习的大量工作已表明模型过参数化在梯度下降(GD)收敛到全局最优解方面的重要性。相比之下,无监督设置尤其是 GANs 涉及非凸凹极小极大优化问题,通常使用梯度下降/上升(GDA)进行训练。模型过参数化在 GDA 收敛到非凸凹问题的全局鞍点中的作用和益处远未被充分理解。在这项工作中,我们从理论和经验上全面分析了模型过参数化在 GANs 中的重要性。我们从理论上证明,在一个具有 层神经网络生成器和线性判别器的过参数化 GAN 模型中,GDA 收敛到基础非凸凹极小极大问题的全局鞍点。据我们所知,这是此类设置中 GDA 全局收敛的首个结果。我们的理论基于一个更一般的结果,该结果适用于服从某些假设(包括更深生成器和随机特征判别器)的更广泛类别的非线性生成器和判别器。我们还使用在 CIFAR-10 和 Celeb-A 数据集上的几个大规模实验,从经验上研究了模型过参数化在 GANs 中的作用。我们的实验表明,过参数化在各种模型架构和数据集上提升了生成样本的质量。值得注意的是,我们观察到过参数化总体上带来了更快且更稳定的 GDA 收敛行为。
引用
@article{arxiv.2104.05605,
title = {Understanding Overparameterization in Generative Adversarial Networks},
author = {Yogesh Balaji and Mohammadmahdi Sajedi and Neha Mukund Kalibhat and Mucong Ding and Dominik Stöger and Mahdi Soltanolkotabi and Soheil Feizi},
journal= {arXiv preprint arXiv:2104.05605},
year = {2021}
}
备注
Accepted in ICLR 2021