中文

GAN 中 SGD 的收敛性与样本复杂度

机器学习 2020-12-02 v1 统计理论 统计理论

摘要

我们为通过 SGD 训练生成对抗网络(GANs)提供了理论收敛保证。我们考虑学习一个由带非线性激活函数 ϕ()\phi(\cdot) 的单层生成器网络建模的目标分布,该网络由 d×dd \times d 权重矩阵 W\mathbf W_* 参数化,即 f(x)=ϕ(Wx)f_*(\mathbf x) = \phi(\mathbf W_* \mathbf x)。我们的主要结果是,根据 Goodfellow 等人提出的随机梯度下降-上升迭代训练生成器与判别器,可得到逼近 ff_* 目标分布的生成器分布。具体而言,我们可以使用 O~(d2/ϵ2)\tilde O(d^2/\epsilon^2) 样本在总变距离 ϵ\epsilon 内学习目标分布,这是(近)信息论最优的。我们的结果适用于广泛类别的非线性激活函数 ϕ\phi,包括 ReLUs,并通过与截断统计的联系以及对判别器网络的恰当设计得以实现。我们的方法依赖于一个双层优化框架来证明朴素 SGDA 的有效性。

关键词

引用

@article{arxiv.2012.00732,
  title  = {Convergence and Sample Complexity of SGD in GANs},
  author = {Vasilis Kontonis and Sihan Liu and Christos Tzamos},
  journal= {arXiv preprint arXiv:2012.00732},
  year   = {2020}
}