中文

面向LLM微调的梯度基数据选择的影响保持代理

机器学习 2026-02-23 v1

摘要

监督微调( SFT )在选择能最大化模型下游性能的训练数据方面起到了关键作用。梯度基数据选择方法如 TracIn 和影响函数利用影响力识别有用样本,但计算成本随模型参数规模而线性增长,难以应用于多数十亿参数的大型语言模型( LLM)。常见的替代方法是使用即插即用的较小模型作为代理,但它们仍不够次优,因为其学习动力学不清晰、规模无法灵活调整,且无法进一步对目标模型进行梯度基于影响估计的对齐。为此,我们提出 Iprox ,一个两阶段框架,从目标模型直接派生影响保持代理。它首先应用低秩压缩阶段保留目标模型的影响信息,然后通过对齐模型梯度和 logits 的对齐阶段,从而构建可灵活控制计算成本同时保留目标模型影响力的代理。实验结果表明,Iprox 在多样化的 LLM 家族和评估任务中 consistently 超越即插即用的代理和基线方法。在 Qwen3-4B 上,一个 1.5B 的代理通过 Iprox 的性能优于更大的 1.7B 即插即用代理。值得注意的是,在 Llama3.2 上,Iprox 在性能上优于基线方法,同时将计算成本相对于完整的 3B 模型缩减了超过一半。这表明 Iprox 提供了有效的影响保持代理,使得 LLM 的梯度基数据选择更加可扩展。

关键词

引用

@article{arxiv.2602.17835,
  title  = {Influence-Preserving Proxies for Gradient-Based Data Selection in LLM Fine-tuning},
  author = {Sirui Chen and Yunzhe Qi and Mengting Ai and Yifan Sun and Ruizhong Qiu and Jiaru Zou and Jingrui He},
  journal= {arXiv preprint arXiv:2602.17835},
  year   = {2026}
}