中文

自消耗生成模型的理论理解

机器学习 2024-06-25 v2 人工智能

摘要

本文应对在自消耗循环中训练生成模型的新兴挑战,其中连续几代模型递归地在来自前几代的真实数据和合成数据的混合上训练。我们构建了一个理论框架,严格评估这种训练过程如何影响未来模型学习的数据分布,包括参数和非参数模型。具体来说,我们推导了未来模型产生的合成数据分布与原始真实数据分布之间的总变差(TV)距离在各种混合训练场景下的界限,针对具有单隐藏层神经网络得分函数的扩散模型。我们的分析表明,在混合训练数据集大小或真实数据比例足够大的条件下,该距离可以有效控制。有趣的是,我们进一步揭示了由扩展合成数据量引起的相变,理论上证明了虽然TV距离最初上升,但超过某个阈值点后会下降。最后,我们给出了核密度估计的结果,提供了细微的见解,例如混合数据训练对误差传播的影响。

关键词

引用

@article{arxiv.2402.11778,
  title  = {Towards Theoretical Understandings of Self-Consuming Generative Models},
  author = {Shi Fu and Sen Zhang and Yingjie Wang and Xinmei Tian and Dacheng Tao},
  journal= {arXiv preprint arXiv:2402.11778},
  year   = {2024}
}

备注

Accepted at ICML 2024