中文

如何在不导致模型崩溃的情况下合成文本数据?

计算与语言 2025-05-29 v3 人工智能 机器学习

摘要

合成数据中的模型崩溃表明,对自生成数据的迭代训练会导致性能逐渐下降。随着 AI 模型的普及,合成数据将根本性地重塑 web 数据生态系统。未来的 GPT-\{n\} 模型不可避免地将在合成数据与人工生产数据混合中进行训练。本文聚焦于两个问题:合成数据对语言模型训练有何影响,以及如何在不导致模型崩溃的情况下合成数据?我们首先对不同比例的合成数据进行预训练,揭示了合成数据比例与模型性能之间的负相关。我们进一步对合成数据进行统计分析,揭示分布迁移现象和 n-gram 特征过度集中的问题。鼓舞于上述发现,本文提出一种针对人工生产数据进行 token 编辑以获取准合成数据的方法。作为一种概念验证,我们理论上演示了 token 级别的编辑可防止模型崩溃,因为测试误差受有限上限的约束。我们在从头预训练、持续预训练和监督式微调等方面进行了广泛实验。结果验证了我们的理论证明,表明 token 级别的编辑可提高模型性能。

关键词

引用

@article{arxiv.2412.14689,
  title  = {How to Synthesize Text Data without Model Collapse?},
  author = {Xuekai Zhu and Daixuan Cheng and Hengli Li and Kaiyan Zhang and Ermo Hua and Xingtai Lv and Ning Ding and Zhouhan Lin and Zilong Zheng and Bowen Zhou},
  journal= {arXiv preprint arXiv:2412.14689},
  year   = {2025}
}

备注

Accepted at ICML 2025