中文

重新思考数据合成:一种带解释的教师模型训练方案

计算与语言 2024-12-10 v2 人工智能

摘要

大型语言模型(LLM)训练的最新进展凸显了对多样化、高质量指令数据的需求。近期,许多工作正在探索使用 LLM 生成合成数据。然而,它们主要关注使用标准监督指令微调模型进行提示工程,这存在一个根本局限:这些模型针对一般问答/问题求解进行了优化,而非针对数据生成。我们通过研究如何专门为数据生成训练模型,提出了一种名为 \textbf{NOMAD} 的范式转换,并证明该任务与训练经典语言模型有显著差异。我们确定了两个关键因素:无提示掩码训练(no-prompt-masked training)和适当的训练集大小选择。我们的方法 NOMAD 相比基线取得了显著改进,在 TriviaQA 上取得了 >4% 的提升,在 GSM8K 上取得了 >2% 的提升,且仅使用了有限的训练数据。最后,我们通过从“相关性”和“新颖性”的角度解释合成数据,提供了新的见解。

关键词

引用

@article{arxiv.2410.20362,
  title  = {Rethinking Data Synthesis: A Teacher Model Training Recipe with Interpretation},
  author = {Yifang Chen and David Zhu and Simon Du and Kevin Jamieson and Yang Liu},
  journal= {arXiv preprint arXiv:2410.20362},
  year   = {2024}
}