中文

避免模型崩溃的 $\pi^2/6$ 路径的普适性

机器学习 2024-10-31 v1 人工智能 新兴技术 统计理论 机器学习 统计理论

摘要

实证机器学习领域的研究人员最近关注所谓的模型崩溃问题。他们设想了一种丢弃工作流:初始生成模型使用真实数据进行训练,随后真实数据被丢弃,然后模型生成合成数据,基于这些合成数据训练新模型。他们得出结论:随着模型拟合代数的推进,模型会退化。然而,其他研究人员考虑了一种增强工作流,其中原始真实数据在每一代训练中继续使用,并补充来自所有先前世代训练模型的合成数据。在丢弃工作流下,模型崩溃的经验结果得到确认;在增强工作流下,避免模型崩溃的经验结果也得到确认。在增强工作流下,理论证据也确认了特定实例中的避免崩溃;具体而言,Gerstgrasser 等人(2024)发现,对于经典线性回归,任何后续世代的测试风险被原始真实数据单独训练的测试风险的一个适度倍数,即 π2/6\pi^2/6,所界定。一些评论者质疑 Gerstgrasser 等人(2024)所假设的生成模型得出的理论结论的普适性:对于其他任务/模型配对,是否可以得出类似的结论?在本文中,我们证明了 π2/6\pi^2/6 增强风险界在一大类经典统计模型中的普适性,提供了关于为何丢弃工作流下会发生崩溃以及增强工作流下能避免崩溃的关键见解。在此过程中,我们提供了一个框架,能够容纳多种工作流(超越丢弃和增强),从而使实验者能够通过模拟简单高斯过程来判断多种不同工作流的相对优劣。

关键词

引用

@article{arxiv.2410.22812,
  title  = {Universality of the $\pi^2/6$ Pathway in Avoiding Model Collapse},
  author = {Apratim Dey and David Donoho},
  journal= {arXiv preprint arXiv:2410.22812},
  year   = {2024}
}

备注

30 pages