中文

舍本取精:面向大语言模型微调的数据选择重新思考

计算与语言 2025-02-25 v2

摘要

大语言模型(LLM)的微调数据选择旨在从现有数据集中选择高质量子集,使训练得到的模型在完整数据集上训练的基线模型之上表现更好。然而,既有研究缺乏清晰、统一的框架,实验设置的差异性也限制了系统性比较。虽然既有综述全面概述了数据选择的阶段和方法,但往往忽略对微调阶段深入探讨。本文针对LLM微调的数据选择技术进行了聚焦性综述,分析了数十项关键研究。我们引入一种新型三阶段方案——包括特征提取、标准设计和选择器评估——来系统性地分类和评估这些方法。此外,我们提出一种统一的比较方法,纳入比例效率和排序可行性指标,以解决实验间的不一致性。我们的发现表明,强调更精准质量衡量的方法在效率方面更高,但以可行性为代价。最后,我们讨论了趋势,概述了微调数据选择中的四个关键挑战,并提供了未来研究的潜在方向。

关键词

引用

@article{arxiv.2406.14115,
  title  = {Take the essence and discard the dross: A Rethinking on Data Selection for Fine-Tuning Large Language Models},
  author = {Ziche Liu and Rui Ke and Yajiao Liu and Feng Jiang and Haizhou Li},
  journal= {arXiv preprint arXiv:2406.14115},
  year   = {2025}
}

备注

Accepted by the NAACL 2025 main conference