复刻训练:大型语言模型训练中真实数据的价值
计算与语言
2024-07-26 v2 人工智能
机器学习
摘要
如果我们使用至少部分由其他大型语言模型(LLM)生成的数据来训练新的大型语言模型会发生什么?LLM的爆发性成功意味着相当大比例的网络内容将由LLM而非人类生成,这不可避免地会进入下一代LLM的训练数据集中。我们评估了这种“复刻式训练”对LLM性能的影响。通过在机器翻译任务中使用由自身或其他LLM生成的数据对GPT-3.5进行微调,我们发现复刻式训练明显损害了LLM的性能。我们在从头训练的变换器模型上也观察到了相同的性能损失。我们得出结论,复刻式训练的性能劣势至少可归因于两个机制:(1) LLM生成的数据相对于真实数据具有更高的错误率;(2) LLM生成的数据在词汇多样性方面低于真实数据。基于这些机制,我们提出并评估了三种不同的策略来缓解复刻式训练的性能损失。首先,我们设计数据驱动的指标来衡量每个LLM生成数据实例的质量,然后进行有序训练,其中高质量数据在低质量数据之前。其次,我们将来自多个不同LLM生成的数据相组合(用于增加词汇多样性)。第三,我们训练一个AI检测分类器来区分LLM和人类生成的数据,并按接近人类生成数据的程度包含LLM生成的数据。所有三种策略都能在某种程度上提高复刻式训练的性能,但总不能完全弥补使用真实数据训练的差距。我们的结果凸显了在训练LLM时真实的人类生成数据不可被轻易用人工生成的LLM数据所取代的价值。
引用
@article{arxiv.2407.12835,
title = {Regurgitative Training: The Value of Real Data in Training Large Language Models},
author = {Jinghui Zhang and Dandan Qiao and Mochen Yang and Qiang Wei},
journal= {arXiv preprint arXiv:2407.12835},
year = {2024}
}