中文

如果你说我的语言,我学得更好:理解用 LLM 生成的回复微调大语言模型的优越性能

计算与语言 2025-12-09 v5 人工智能

摘要

本文探讨了一个有趣的现象:使用 LLM 生成的回复微调大语言模型(LLM)通常比使用人类生成的回复产生更好的结果,尤其是在推理任务中。我们进行了深入调查以理解其原因。与普遍认为这些情况归因于 LLM 生成内容更详细的观点相反,我们的研究发现了另一个促成因素:LLM 本质上更“熟悉” LLM 生成的回复。这种熟悉性表现为微调前更低的困惑度。我们设计了一系列实验来理解“熟悉性”的影响,我们的结论表明,这种“熟悉性”显著影响学习性能。使用 LLM 生成的回复进行训练不仅提高了性能,还有助于在针对特定任务进行微调后,维持模型在其他推理任务上的能力。

关键词

引用

@article{arxiv.2402.11192,
  title  = {I Learn Better If You Speak My Language: Understanding the Superior Performance of Fine-Tuning Large Language Models with LLM-Generated Responses},
  author = {Xuan Ren and Biao Wu and Lingqiao Liu},
  journal= {arXiv preprint arXiv:2402.11192},
  year   = {2025}
}

备注

The paper has been accepted to EMNLP 2024 (Main Conference) there is a follow up paper: Efficiently Selecting Response Generation Strategies for Synthetic Data Construction by Self-Aligned Perplexity Note: This is a revised version of arXiv:2402.11192 (v1, submitted 17 Feb 2024)