Filter-then-Weight:用于 LLM 微调的在线数据选择与重加权
机器学习
2026-05-14 v2 人工智能
计算与语言
摘要
基于梯度的数据选择提供了一种原则性的框架,用于估计大语言模型(LLM)微调中样本的实用性,但现有方法大多设计用于离线环境,因此不适用于在线微调场景。在线微调中,数据按顺序到达,样本实用性随步骤变化,有效更新几何由自适应优化器塑造。我们提出了一个针对 LLM 微调中基于梯度的在线数据选择和重加权的优化器感知框架。我们的关键思想是将在线选择视为在当前优化器状态下塑造下一个以目标为导向的更新,而非静态样本排序。我们将其表述为优化器感知的 update-matching 问题,建立其与二阶目标实用性之间的联系,表明子集级构建必须考虑所选样本之间的相互作用和冗余性。基于这一视角,我们开发了一个两个阶段的 Filter-then-Weight 算法,首先筛选几何上有用的候选样本,然后优化其系数。为使该框架实用于 LLM,我们引入了因式分解外积梯度表示和针对长上下文数据的优化矩阵计算。实验表明,我们的方法在相同数据预算下, consistently improved convergence and downstream performance over existing online data selection baselines。
引用
@article{arxiv.2604.00001,
title = {Filter-then-Weight: Online Data Selection and Reweighting for LLM Fine-Tuning},
author = {Fangxin Wang and Peyman Baghershahi and Langzhou He and Henry Peng Zou and Sourav Medya and Philip S. Yu},
journal= {arXiv preprint arXiv:2604.00001},
year = {2026}
}
备注
24 pages, 2 figures, 9 tables