中文

生成模型在其自身数据上迭代重训练的稳定性研究

机器学习 2024-04-03 v5 机器学习

摘要

深度生成模型在建模复杂数据方面取得了巨大进展,其生成质量常常超越普通人辨别样本真伪的能力。不可否认,这一成功的关键驱动力在于这些模型所消耗的海量网络规模数据。由于这些模型令人瞩目的性能和易获取性,网络上不可避免地会充斥越来越多合成内容。这一事实直接意味着未来迭代的生成模型将在来自过去模型的干净数据与人工生成数据混合的基础上进行训练。本文中,我们开发了一个框架,严谨地研究在混合数据集上训练生成模型的影响——从在真实数据上的经典训练,到在纯合成数据上训练的自消耗生成模型。我们首先证明了在初始生成模型足够好地近似数据分布且干净训练数据(相对于合成数据)比例足够大的条件下,迭代训练的稳定性。我们在合成图像与自然图像上通过迭代地在 CIFAR10 和 FFHQ 上训练归一化流与最先进的扩散模型,对理论进行了实证验证。

关键词

引用

@article{arxiv.2310.00429,
  title  = {On the Stability of Iterative Retraining of Generative Models on their own Data},
  author = {Quentin Bertrand and Avishek Joey Bose and Alexandre Duplessis and Marco Jiralerspong and Gauthier Gidel},
  journal= {arXiv preprint arXiv:2310.00429},
  year   = {2024}
}