消融还是繁荣?合成数据在自生成世界中的风险与愿景
机器学习
2025-03-19 v4 人工智能
摘要
当生成式机器学习模型在包含由早期模型生成数据的数据集上进行预训练时,会发生什么情况?一些先前的工作警告由于网络被合成数据淹没将导致“模型消融”;其他工作则暗示通过管理预训练中可用数据的使用方式可以控制该问题(即可以避免消融)。本文我们报告了在三种数据使用方式(训练工作流程)以及三种生成模型任务设置(多变量高斯估计、核密度估计和语言模型微调)上的实验,以进一步确认可控性的可能性:(a)我们确认将所有真实数据替换为纯合成数据的训练工作流程在所研究的所有任务设置中都会出现模型消融;(b)我们考虑将合成数据与真实数据累积在一起并训练于所有数据上的工作流程,尽管真实数据的比例最终变为零,但在该工作流程下,模型保持稳定,其测试损失不会发散;(c)我们考虑一种训练工作流程,其中真实数据和合成数据累积在一起,但 successive generations of pretraining 受限于使用固定大小的数据子集进行。我们观察到在该工作流程下,测试损失性能跨代呈现缓慢和渐进的退化,而非爆炸式退化。我们的见解对于预测未来前沿生成模型是消融还是繁荣至关重要,我们的结果为从经验和数学角度研究合成数据情境相关价值开辟了研究之路。
引用
@article{arxiv.2410.16713,
title = {Collapse or Thrive? Perils and Promises of Synthetic Data in a Self-Generating World},
author = {Joshua Kazdan and Rylan Schaeffer and Apratim Dey and Matthias Gerstgrasser and Rafael Rafailov and David L. Donoho and Sanmi Koyejo},
journal= {arXiv preprint arXiv:2410.16713},
year = {2025}
}
备注
Accepted at NeurIPS 2024 Workshops: Mathematics of Modern Machine Learning (M3L) and Attributing Model Behavior at Scale (ATTRIB)