作为收敛梯度流的 GAN
机器学习
2024-01-09 v2 最优化与控制
摘要
本文通过概率密度函数空间中的梯度下降处理无监督学习问题。一个主要结果表明,在由分布依赖常微分方程(ODE)诱导的梯度流上,未知数据分布作为长时间极限浮现。也就是说,可以通过模拟该分布依赖 ODE 来揭示数据分布。有趣的是,该 ODE 的模拟被证明等价于生成对抗网络(GANs)的训练。这种等价性提供了对 GAN 的一种新“协作”视角,更重要的是,为 GAN 的发散现象提供了新见解。特别地,它揭示了 GAN 算法隐式地最小化两组样本之间的均方误差(MSE),而仅此 MSE 拟合就可能导致 GAN 发散。为构造分布依赖 ODE 的解,我们首先通过 Banach 空间中微分方程的 Crandall-Liggett 定理证明相关的非线性 Fokker-Planck 方程存在唯一弱解。基于该 Fokker-Planck 方程的解,我们利用 Trevisan 叠加原理构造了 ODE 的唯一解。所诱导梯度流到数据分布的收敛性通过分析 Fokker-Planck 方程得到。
引用
@article{arxiv.2205.02910,
title = {GANs as Gradient Flows that Converge},
author = {Yu-Jui Huang and Yuchong Zhang},
journal= {arXiv preprint arXiv:2205.02910},
year = {2024}
}