学习多指标权重用于数据选择:一种结合任务-模型自适应的高效代理框架
机器学习
2026-05-12 v1 人工智能
计算与语言
摘要
数据选择是大语言模型高效指令微调的关键组件,因为近期工作表明数据质量通常比数据数量更重要。因此,先前的研究引入了各种多维启发式方法来评估和过滤指令数据。然而,大多数现有方法依赖于静态的任务无关和模型无关加权方案,忽略了特定下游任务的不同要求以及模型间不同的既有能力。在本文中,我们提出了一个学习多指标权重的框架,将数据选择与下游任务和特定模型共同自适应。我们的方法通过在紧凑的微型验证集上利用上下文学习(ICL)信号,无需全量微调即可识别最优权重配置。这些信号作为高效性能代理,确保以极低的计算成本进行高保真评估。在包括 Mistral、Qwen 和 Llama 在内的多个基准和模型家族上的实验表明,该方法在 GSM8K 上仅使用 30% 的训练样本,即可达到与全量数据微调相当或更优的性能。此外,我们的分析揭示了推理任务中语义多样性与逻辑复杂性之间的权衡,突出了任务-模型联合自适应的必要性。
引用
@article{arxiv.2605.09665,
title = {Learning Multi-Indicator Weights for Data Selection: A Joint Task-Model Adaptation Framework with Efficient Proxies},
author = {Jingze Song and Zihao Chen and Wenqing Chen and Zibin Zheng},
journal= {arXiv preprint arXiv:2605.09665},
year = {2026}
}
备注
This work has been accepted at IJCAI 2026