中文

面向指令微调的基于不确定性感知梯度信噪比的数据选择

计算与语言 2026-01-21 v1 人工智能 机器学习

摘要

指令微调是适配大语言模型(LLM)的标准范式,但现代指令数据集庞大、嘈杂且冗余,使得全数据微调成本高昂且往往不必要。现有的数据选择方法要么构建昂贵的梯度数据存储,要么从弱代理模型分配静态分数,很大程度上忽略了不断变化的不确定性,从而错失了LLM可解释性的一个关键来源。我们提出了GRADFILTERING,一个目标无关、不确定性感知的数据选择框架,它利用一个带有LoRA集成的小型GPT-2代理模型,并将每个样本的梯度聚合为梯度信噪比(G-SNR)效用指标。在大多数LLM-as-a-judge评估以及人工评估中,我们的方法匹配或超越了随机子集和强基线方法。此外,在相同的计算预算下,GRADFILTERING选择的子集比竞争性过滤器收敛得更快,这反映了不确定性感知评分的优势。

关键词

引用

@article{arxiv.2601.13697,
  title  = {Uncertainty-Aware Gradient Signal-to-Noise Data Selection for Instruction Tuning},
  author = {Zhihang Yuan and Chengyu Yue and Long Huang and Litu Ou and Lei Shi},
  journal= {arXiv preprint arXiv:2601.13697},
  year   = {2026}
}

备注

Preprint