结构化互动学习中何时会发生模型崩溃?
机器学习
2026-05-20 v1 统计理论
统计理论
摘要
生成式人工智能的不断扩张催生了一种互动学习环境,其中模型参数不仅使用由自然过程生成的数据,还使用由其他模型产生的合成输出进行持续更新。这种范式引入了两个主要挑战:(1)训练数据不再仅来自目标总体,动摇经典统计学习的核心假设;(2)模型训练过程变得内在相关,因为模型通过反复暴露于彼此的合成输出而相互作用,方式可能相当复杂。因此,在此类结构化互动学习环境中建立可靠的统计推断仍是一个重要的开放问题。特别是,越来越多人担忧模型崩溃——即生成模型在使用由早期模型生成的合成数据进行训练时,性能会逐渐恶化。此前关于模型崩溃的工作主要关注单一模型在其自身输出上训练的情况,未能捕捉多模型互动设置下的模型性能。本文通过研究一般互动模式下的生成模型性能来填补这一空白。特别是,我们使用有向图形式化模型互动,表明模型崩溃的发生取决于互动图的拓扑结构。我们进一步推导了明确的必要且充分条件,描述何时会发生模型崩溃,并为线性回归和一般M估计器给出有限样本结果和渐近保证。我们通过大量数值实验支持我们的理论发现。
引用
@article{arxiv.2605.20151,
title = {When Does Model Collapse Occur in Structured Interactive Learning?},
author = {Yuchen Wu and Kangjie Zhou and Weijie Su},
journal= {arXiv preprint arXiv:2605.20151},
year = {2026}
}
备注
57 pages, 12 figures