TACOS:面向指令微调数据选择的开放标签与比较评分
计算与语言
2026-03-25 v1 人工智能
摘要
指令微调(IFT)对于使大语言模型(LLM)与人类偏好对齐至关重要,从海量数据中选择一个规模小但具有代表性的子集,在效率和有效性上都极大地促进了 IFT。然而,现有方法存在两个局限性:使用简单启发式方法限制了数据多样性,而单例数据质量评估导致独立样本之间的标准不一致。为了解决这些问题,我们提出了 TACOS,一种集成了开放标签与比较评分的 IFT 数据选择创新方法。为了捕捉数据多样性,我们利用 LLM 为人类查询分配开放域标签,随后进行归一化阶段以对开放标签去噪并实现高效聚类。此外,我们提出了一种比较评分方法,允许对同一聚类内的样本进行相对质量评估,避免了单例评估中出现的标准不一致问题。在多个数据集和 LLM 架构上的大量实验表明,TACOS 大幅优于现有方法。值得注意的是,它在 MT-Bench 上实现了卓越的指令遵循性能,并在 AlpacaEval 2.0 上基于 LLaMA2-7B 的模型中排名第一,证明了其在 IFT 数据选择上的有效性。
引用
@article{arxiv.2507.03673,
title = {TACOS: Open Tagging and Comparative Scoring for Instruction Fine-Tuning Data Selection},
author = {Xixiang He and Hao Yu and Qiyao Sun and Ao Cheng and Tailai Zhang and Cong Liu and Shuxuan Guo},
journal= {arXiv preprint arXiv:2507.03673},
year = {2026}
}