测量指令微调的数据多样性:系统性分析与可靠度量
计算与语言
2025-06-03 v5
摘要
数据多样性对于大语言模型的指令微调至关重要。现有研究探索了各种感知多样性的数据选择方法,以构建高质量数据集并提升模型性能。然而,精确定义和测量数据多样性这一基本问题仍缺乏充分研究,限制了对数据工程的明确指导。为此,我们通过大量微调实验评估其与模型性能的相关性,系统分析了 11 种现有的多样性测量方法。结果表明,可靠的多样性度量应适当考虑样本间差异以及样本空间中的信息密度。在此基础上,我们提出了 NovelSum,一种基于样本级“新颖性”的多样性度量。在模拟数据和真实数据上的实验表明,NovelSum 能准确捕捉多样性变化,并与指令微调后的模型性能达到 0.97 的相关性,突显了其在指导数据工程实践方面的价值。以 NovelSum 作为优化目标,我们进一步开发了一种贪心、面向多样性的数据选择策略,其表现优于现有方法,验证了我们度量的有效性与实际意义。代码可在 https://github.com/UmeanNever/NovelSum 获取。
引用
@article{arxiv.2502.17184,
title = {Measuring Data Diversity for Instruction Tuning: A Systematic Analysis and A Reliable Metric},
author = {Yuming Yang and Yang Nan and Junjie Ye and Shihan Dou and Xiao Wang and Shuo Li and Huijie Lv and Mingqi Wu and Tao Gui and Qi Zhang and Xuanjing Huang},
journal= {arXiv preprint arXiv:2502.17184},
year = {2025}
}
备注
Accepted at ACL 2025 Main. Camera-ready version updated (20 pages). Project page: https://github.com/UmeanNever/NovelSum