MIG:通过在语义空间最大化信息增益进行指令调优自动数据选择
计算与语言
2025-04-21 v1 人工智能
摘要
数据质量和多样性是构建有效指令调优数据集的关键。随着开源指令调优数据集的不断增长,自动从海量数据中筛选出高质量且多样化的子集变得尤为重要。现有方法通常侧重实例质量,并使用启发式规则维持多样性。然而,这些方法缺乏对整个数据集合的全面视角,往往导致次优结果。此外,启发式规则通常仅关注嵌入空间中的距离或聚类,无法准确捕捉复杂指令在语义空间中的意图。为弥合这一差距,我们提出了一种统一的数据量化方法。该方法通过构建标签图来建模语义空间,并基于图中信息分布来量化多样性。基于此度量,我们进一步引入一种高效采样方法,迭代性地选择数据样本以实现语义空间中的信息增益最大化(MIG)。在Various数据集和基础模型上的实验表明,MIG consistently优于最先进的方法。值得注意的是,使用MIG采样的5% Tulu3数据微调的模型,其在AlpacaEval和Wildbench上的性能分别提升了+5.73%和+6.89%,相当于官方在完整数据集上训练的SFT模型。
引用
@article{arxiv.2504.13835,
title = {MIG: Automatic Data Selection for Instruction Tuning by Maximizing Information Gain in Semantic Space},
author = {Yicheng Chen and Yining Li and Kai Hu and Zerun Ma and Haochen Ye and Kai Chen},
journal= {arXiv preprint arXiv:2504.13835},
year = {2025}
}