中文

揭示人工合成数据中的缺陷:大语言模型的缓解策略探索

计算与语言 2024-06-19 v1

摘要

人工合成数据被提议作为解决大型语言模型(LLM)训练中高质量数据稀缺问题的方案。研究表明,人工合成数据可以有效提高 LLM 在下游基准测试上的性能。然而,尽管存在这些潜在好处,但我们的分析表明,人工合成数据可能存在内在缺陷。人工合成数据的统一格式可能导致模式过拟合并导致输出分布发生显著偏移,从而降低模型的指令遵循能力。我们的工作深入研究了与问答(Q-A)对相关的这些具体缺陷,并提出一种基于遗忘技术的方法来缓解这些缺陷。实证结果表明,我们的方法可以在保持基准测试性能的同时,以相对较低的成本逆转由模式过拟合导致的指令遵循问题。我们的工作提供了关于有效使用人工合成数据以促进更稳健和更高效 LLM 训练的关键见解。

关键词

引用

@article{arxiv.2406.12397,
  title  = {Unveiling the Flaws: Exploring Imperfections in Synthetic Data and Mitigation Strategies for Large Language Models},
  author = {Jie Chen and Yupeng Zhang and Bingning Wang and Wayne Xin Zhao and Ji-Rong Wen and Weipeng Chen},
  journal= {arXiv preprint arXiv:2406.12397},
  year   = {2024}
}

备注

15 pages