T-SHIRT:面向指令微调的 Token 选择性层次化数据选择
机器学习
2025-12-02 v2 人工智能
摘要
指令微调对于大型语言模型(LLM)有效遵循用户指令至关重要。为了提高训练效率并减少数据冗余,近期的研究使用基于 LLM 的评分函数(例如指令遵循难度(IFD))来选择评分高于阈值的优质指令微调数据。尽管这些数据选择方法通常能使训练出的模型性能匹配甚至在全量数据集上训练的模型,但我们发现了两个关键局限性: 评估在样本级别进行,忽略了 token 级别的信息量; 忽略了评分方法的鲁棒性,常常因为表面的词汇特征而非样本的真实质量来选择数据。在本文中,我们提出了面向指令微调的 Token 选择性层次化数据选择,这是一种新颖的数据选择框架。该框架引入了一种新的评分方法,在质量评估中仅包含信息量大的 token,并提升具有鲁棒性和可靠性的样本,这些样本的邻居也表现出高质量且局部不一致性较小。我们证明,使用 T-SHIRT 在精选数据集(仅为原始规模的 5%)上微调的模型,在八个基准测试中平均性能甚至可以超过在全量大规模数据集上训练的模型高达 5.48 个百分点。在各种 LLM 和训练集规模下,我们的方法始终超越现有的最先进数据选择技术,同时保持高性价比和高效率。例如,使用 GPT-2 进行评分计算,我们能够在单张 GPU 上 40 分钟内处理包含 52k 个样本的数据集。我们的代码可在 https://github.com/Dynamite321/T-SHIRT 获取。
关键词
引用
@article{arxiv.2506.01317,
title = {T-SHIRT: Token-Selective Hierarchical Data Selection for Instruction Tuning},
author = {Yanjun Fu and Faisal Hamman and Sanghamitra Dutta},
journal= {arXiv preprint arXiv:2506.01317},
year = {2025}
}
备注
NeurIPS 2025