如果你说我的语言,我学得更好:理解用 LLM 生成的回复微调大语言模型的优越性能
计算与语言
2025-12-09 v5 人工智能
摘要
本文探讨了一个有趣的现象:使用 LLM 生成的回复微调大语言模型(LLM)通常比使用人类生成的回复产生更好的结果,尤其是在推理任务中。我们进行了深入调查以理解其原因。与普遍认为这些情况归因于 LLM 生成内容更详细的观点相反,我们的研究发现了另一个促成因素:LLM 本质上更“熟悉” LLM 生成的回复。这种熟悉性表现为微调前更低的困惑度。我们设计了一系列实验来理解“熟悉性”的影响,我们的结论表明,这种“熟悉性”显著影响学习性能。使用 LLM 生成的回复进行训练不仅提高了性能,还有助于在针对特定任务进行微调后,维持模型在其他推理任务上的能力。
引用
@article{arxiv.2402.11192,
title = {I Learn Better If You Speak My Language: Understanding the Superior Performance of Fine-Tuning Large Language Models with LLM-Generated Responses},
author = {Xuan Ren and Biao Wu and Lingqiao Liu},
journal= {arXiv preprint arXiv:2402.11192},
year = {2025}
}
备注
The paper has been accepted to EMNLP 2024 (Main Conference) there is a follow up paper: Efficiently Selecting Response Generation Strategies for Synthetic Data Construction by Self-Aligned Perplexity Note: This is a revised version of arXiv:2402.11192 (v1, submitted 17 Feb 2024)