面向有针对性的指令选择的批判性分析:分离哪些是重要的,哪些是无关的
机器学习
2026-02-17 v1
摘要
指令微调大型语言模型(LLM)通常涉及从大型候选数据池中选择子集,用于目标任务的小查询集。尽管越来越多地关注此问题,但有针对性的指令选择文献仍然碎片化且不透明:方法在选择预算上差异巨大,常常省略零样本基线,并频繁地将关键组件的贡献捆绑在一起。因此,实践者缺乏针对自身目标任务选择指令的可操作指导。本文旨在通过分离和系统性分析两个核心要素:数据表示和选择算法,为这一格局带来清晰度。我们的框架使我们能够在模型、任务和预算之间进行受控比较。我们发现,只有梯度基的数据表示才能选择出其与查询集的相似性在数据集和模型之间一致预测性能的子集。尽管没有单一方法占据上风,梯度基表示配合贪心轮转选择算法在低预算下平均表现最佳,但这些优势在较大预算下会逐渐消退。最后,我们将几个现有选择算法统一为在选定子集与查询集之间近似距离最小化的形式,并通过新的泛化界限支持这一观点。更广泛地说,我们的发现提供了关键见解,为LLM微调中的更原则的数据选择奠定了基础。代码已公开于 https://github.com/dcml-lab/targeted-instruction-selection。
引用
@article{arxiv.2602.14696,
title = {A Critical Look at Targeted Instruction Selection: Disentangling What Matters (and What Doesn't)},
author = {Nihal V. Nayak and Paula Rodriguez-Diaz and Neha Hulkund and Sara Beery and David Alvarez-Melis},
journal= {arXiv preprint arXiv:2602.14696},
year = {2026}
}