面向指令微调的基于不确定性感知梯度信噪比的数据选择
计算与语言
2026-01-21 v1 人工智能
机器学习
摘要
指令微调是适配大语言模型(LLM)的标准范式,但现代指令数据集庞大、嘈杂且冗余,使得全数据微调成本高昂且往往不必要。现有的数据选择方法要么构建昂贵的梯度数据存储,要么从弱代理模型分配静态分数,很大程度上忽略了不断变化的不确定性,从而错失了LLM可解释性的一个关键来源。我们提出了GRADFILTERING,一个目标无关、不确定性感知的数据选择框架,它利用一个带有LoRA集成的小型GPT-2代理模型,并将每个样本的梯度聚合为梯度信噪比(G-SNR)效用指标。在大多数LLM-as-a-judge评估以及人工评估中,我们的方法匹配或超越了随机子集和强基线方法。此外,在相同的计算预算下,GRADFILTERING选择的子集比竞争性过滤器收敛得更快,这反映了不确定性感知评分的优势。
引用
@article{arxiv.2601.13697,
title = {Uncertainty-Aware Gradient Signal-to-Noise Data Selection for Instruction Tuning},
author = {Zhihang Yuan and Chengyu Yue and Long Huang and Litu Ou and Lei Shi},
journal= {arXiv preprint arXiv:2601.13697},
year = {2026}
}
备注
Preprint