中文

ForTIFAI:抵御递归训练引起的人工智能模型崩溃

人工智能 2025-11-06 v4 机器学习

摘要

生成式AI模型日益增长的依赖正在快速增加合成数据的量,一些预测甚至暗示到2030年,大部分可用新数据用于训练都可能是机器生成的。这一向主要合成内容转变的趋势提出了一个关键挑战:在合成数据上进行多次训练导致模型崩溃现象,即模型性能随着训练代次的增加而逐渐恶化,最终使模型失效。虽然人们越来越多地理解模型崩溃的原因,但有效的缓解策略仍然稀缺。我们利用一个关键洞察:自回归模型倾向于生成高置信度(即高对数似然)的文本序列。基于此,我们引入Truncated-Cross-Entropy(TCE)损失函数。TCE通过在训练期间有选择地忽略高置信度标记来缓解崩溃,有效地从学习过程中过滤掉可能的机器生成制品。我们的实验表明,使用TCE训练的模型不仅学习有效,而且显示出显著增强的韧性,在崩溃发生前能够容纳超过2.3倍的合成数据。此外,我们提供了一个开源基准,用于混合数据环境中的崩溃动力学。我们的结果表明,信心感知的训练目标在面对合成数据暴露时能显著延迟崩溃的发生,为模型在合成数据暴露下的鲁棒性提供了一种实用且可广泛应用的工具。

关键词

引用

@article{arxiv.2509.08972,
  title  = {ForTIFAI: Fending Off Recursive Training Induced Failure for AI Model Collapse},
  author = {Soheil Zibakhsh Shabgahi and Pedram Aghazadeh and Azalia Mirhoseini and Farinaz Koushanfar},
  journal= {arXiv preprint arXiv:2509.08972},
  year   = {2025}
}