中文

数据污染下的生成式人工智能能否存活?关于受污染递归训练的理论保证

机器学习 2026-02-19 v1 人工智能 统计理论 机器学习 统计理论

摘要

生成式人工智能(如大型语言模型,LLM)已成为跨越科学、产业和社会的变革性力量。随着这些系统流行度提升,网络数据日益交织于人工智能生成材料之中,人们难以将其与自然生成内容区分开来。由于生成模型定期更新,后续模型不可避免地要在人类生成数据与来自早期版本的人工智能生成数据的混合物上进行训练,形成数据污染的递归训练过程。现有理论工作仅探讨了高度简化的设置,其中实质数据和生成模型均为离散或高斯分布,已证明此类递归训练导致模型崩溃。然而,真实数据分布远比此复杂,现代生成模型也远比高斯和线性机制更灵活。为填补这一空白,我们在通用框架下研究递归训练,仅对真实数据分布作最小假设,并允许底层生成模型为通用逼近器。在该框架下,我们证明受污染的递归训练仍然收敛,其收敛率等于基线模型收敛率与每次迭代中真实数据比例的最小值。据我们了解,这是首个在数据分布无假设条件下进行递归训练的(积极)理论结果。我们进一步扩展分析至数据收集中存在抽样偏差的情形,支持所有理论结果并配以实证研究。

关键词

引用

@article{arxiv.2602.16065,
  title  = {Can Generative Artificial Intelligence Survive Data Contamination? Theoretical Guarantees under Contaminated Recursive Training},
  author = {Kevin Wang and Hongqian Niu and Didong Li},
  journal= {arXiv preprint arXiv:2602.16065},
  year   = {2026}
}