关于自举生成在持续学习及其他领域的危险性
机器学习
2025-12-16 v1 人工智能
计算机视觉与模式识别
图像与视频处理
摘要
使用合成生成的数据训练模型正成为一种常见做法。虽然生成的数据可以扩充训练数据,但在合成数据上重复训练会引发对分布漂移和因数据集污染导致性能下降的担忧。我们从持续学习的角度审视这一自举过程的后果,并将其与生成经验回放(GER)方法建立联系。我们提出了一项统计分析,表明合成数据在训练目标中引入了显著的偏差和方差,削弱了最大似然估计的可靠性。我们提供了经验证据,表明流行的生成模型在重复使用合成数据训练时会崩溃。我们量化了这种退化,并表明最先进的GER方法未能在潜在空间中保持对齐。我们的发现对在持续学习中使用合成数据提出了关键性担忧。
引用
@article{arxiv.2512.11867,
title = {On the Dangers of Bootstrapping Generation for Continual Learning and Beyond},
author = {Daniil Zverev and A. Sophia Koepke and Joao F. Henriques},
journal= {arXiv preprint arXiv:2512.11867},
year = {2025}
}
备注
DAGM German Conference on Pattern Recognition, 2025