中文

模型崩溃不可避免吗?通过累积真实数据和合成数据打破递归诅咒

机器学习 2024-05-01 v2 人工智能 计算与语言 新兴技术 机器学习

摘要

生成模型的激增,加上在网页规模数据上的预训练,引发了一个及时的问题:当这些模型在自己的生成输出上训练时会发生什么?最近对模型-数据反馈循环的研究提出,这种循环会导致一种称为模型崩溃的现象,其中性能随着每次模型-数据反馈迭代而逐渐下降,直到拟合的模型变得无用。然而,这些研究大多假设新数据随时间替换旧数据,而一个更现实的假设是数据随时间累积。在本文中,我们问:累积数据对模型崩溃有什么影响?我们通过在文本语料库上预训练语言模型序列来实证研究这个问题。我们确认,用每一代的合成数据替换原始真实数据确实倾向于导致模型崩溃,然后证明将连续几代的合成数据与原始真实数据一起累积可以避免模型崩溃;这些结果在多种模型大小、架构和超参数下都成立。我们在其他类型的真实数据上的深度生成模型上也获得了类似的结果:用于分子构象生成的扩散模型和用于图像生成的变分自编码器。为了理解为什么累积数据可以避免模型崩溃,我们使用先前工作引入的一个解析可处理框架,其中一系列线性模型拟合到先前模型的输出。先前的工作使用该框架表明,如果数据被替换,测试误差随着模型拟合迭代次数的增加而增加;我们将这一论证扩展,证明如果数据累积,测试误差有一个与迭代次数无关的有限上界,这意味着模型崩溃不再发生。

关键词

引用

@article{arxiv.2404.01413,
  title  = {Is Model Collapse Inevitable? Breaking the Curse of Recursion by Accumulating Real and Synthetic Data},
  author = {Matthias Gerstgrasser and Rylan Schaeffer and Apratim Dey and Rafael Rafailov and Henry Sleight and John Hughes and Tomasz Korbak and Rajashree Agrawal and Dhruv Pai and Andrey Gromov and Daniel A. Roberts and Diyi Yang and David L. Donoho and Sanmi Koyejo},
  journal= {arXiv preprint arXiv:2404.01413},
  year   = {2024}
}