中文

指令微调数据集的多样性度量与子集选择

机器学习 2024-02-07 v1 计算与语言

摘要

我们旨在为大型语言模型的微调选择数据子集,以更有效地遵循指令。先前的工作强调了数据集构建中多样性的重要性,但依赖于诸如任务数量等启发式方法。在本文中,我们使用行列式点过程来捕捉指令微调数据集的多样性与质量,以进行子集选择。我们提出使用对数行列式距离来度量数据集多样性,该距离是目标数据集与最大多样性参考数据集之间的距离。我们的实验表明,在归一化权重梯度空间中提出的多样性度量与下游指令遵循性能相关。因此,它可用于判断数据选择最有帮助的时机,并分析数据集构建策略。我们在多种指令微调数据集上展示了该方法的有效性。

关键词

引用

@article{arxiv.2402.02318,
  title  = {Diversity Measurement and Subset Selection for Instruction Tuning Datasets},
  author = {Peiqi Wang and Yikang Shen and Zhen Guo and Matthew Stallone and Yoon Kim and Polina Golland and Rameswar Panda},
  journal= {arXiv preprint arXiv:2402.02318},
  year   = {2024}
}