中文

自回归语言模型在数据为有限集时的崩溃:理论证明

计算与语言 2025-05-20 v3

摘要

自回归语言模型(Auto-regressive language models, LMs)在数据稀缺领域广泛用于生成数据,以培训新的 LM,弥补真实数据的不足。先前的工作在实验中发现,针对递归生成数据训练的 LM 会发生崩溃。本文提出理论证明:一旦语料库(如世界 wide web 的子集)开始纳入生成数据且不再添加新的真实数据,则无论每个 LM 生成数据的量多小,其对语料库的贡献,LM 崩溃在经过充分时间后都是不可避免的。这一发现表明,试图通过限制语料库中合成数据的数量来缓解崩溃是根本不够的。相反,避免崩溃的关键在于确保合成数据的质量。

关键词

引用

@article{arxiv.2412.14872,
  title  = {Theoretical Proof that Auto-regressive Language Models Collapse when Real-world Data is a Finite Set},
  author = {Lecheng Wang and Xianjie Shi and Ge Li and Jia Li and Xuanming Zhang and Yihong Dong and Wenpin Jiao and Hong Mei},
  journal= {arXiv preprint arXiv:2412.14872},
  year   = {2025}
}

备注

20 pages, 3 figures