事后修正:LLM 后训练数据质量与模型性能的比较研究
计算与语言
2026-02-09 v3 人工智能
摘要
近期大语言模型 (Large Language Models, LLMs) 的研究越来越关注后训练和与精心挑选的数据集进行对齐,以提升指令遵循、世界知识和专业技能。然而,主流开放和封闭源 LLMs 所使用的大多数后训练数据集对公众不可得,且关于其构建过程的有限信息导致了这一局面。缺乏透明度促使了近期开源后训练语料库的开发。尽管在训练这些开源替代方案时可获得与领先模型相当的性能,但由于在规模上严格进行系统性比较的计算成本极大,系统性比较仍然面临挑战,因而在文献中屈居于次要地。因此,究竟如何影响评估特定样本、任务类型或精选策略对下游性能的影响,尚不明了。本文我们进行首次对两种突出开源后训练数据集——Tulu-3-SFT-Mix 与 SmolTalk——进行全面就地分析。我们使用 Magpie 框架为每个样本标注详细的质量指标,包括轮次结构 (单轮 vs. 多轮)、任务类别、输入质量和响应质量,并派生揭示两者在结构与质量上的相似性与差异性的统计信息。基于这些洞见,我们设计了一种原则性的精选配方,产生一种新型数据混合物,TuluTalk,其包含比任一来源数据集 14% 更少的样本,同时在关键基准测试中匹配或超越两者的性能。我们的发现为构建更有效的后训练数据集提供了可操作的见解,以提升模型性能且置于实际资源限制之下。为支持未来研究,我们公开发布了标注后的来源数据集以及我们精选的 TuluTalk 混合物。
引用
@article{arxiv.2506.06522,
title = {Fixing It in Post: A Comparative Study of LLM Post-Training Data Quality and Model Performance},
author = {Aladin Djuhera and Swanand Ravindra Kadhe and Syed Zawad and Farhan Ahmed and Heiko Ludwig and Holger Boche},
journal= {arXiv preprint arXiv:2506.06522},
year = {2026}
}