赢得修剪赌局:面向高效监督微调的统一方法
计算与语言
2026-02-04 v2
摘要
监督微调 (SFT) 正从一个轻量级后训练步骤演变为规模与中期训练相当的计算密集型阶段,数据效率已成为受限预算下大型语言模型 (LLM) 对齐的关键。现有数据修剪方法存在设计碎片化:它们要么在样本层面运行,要么在 token 层面独立运行,无法联合优化这两个维度。这种脱节导致显著效率低下——高价值样本可能仍包含冗余 token,而 token 级别的修剪往往会丢弃个别示例中嵌入的关键指令或纠错信号。为克服此瓶颈,我们提出了错误-不确定性 (EU) 平面,这是一种诊断框架,用于联合描述训练数据在样本和 token 之间异质效用。我们提出了基于四象限的调优 (Q-Tuning),一种统一框架,战略性地协调样本修剪和 token 修剪。Q-Tuning 采用两阶段策略:首先进行样本级别的分诊,以保留富含信息性误解或校准信号的示例;其次应用非对称 token 修剪策略,利用基于上下文的评分机制仅从误解样本中修剪较不显著的 token,同时完整保留校准样本。我们的方法在五个多样化基准上均达到新的最佳成绩。令人惊讶的是,在 SmolLM2-1.7B 上,Q-Tuning 仅使用原始训练数据的 12.5% 即可实现对全数据 SFT 基线的 +38% 平均提升。作为首个在一致上超越全数据训练的动态修剪方法,Q-Tuning 提供了一种实用且可扩展的蓝图,以在预算受限的情况下最大化 LLM SFT 的数据利用率。
引用
@article{arxiv.2509.23873,
title = {Winning the Pruning Gamble: A Unified Approach to Joint Sample and Token Pruning for Efficient Supervised Fine-Tuning},
author = {Shaobo Wang and Jiaming Wang and Jiajun Zhang and Cong Wang and Yue Min and Zichen Wen and Xingzhang Ren and Fei Huang and Huiqiang Jiang and Junyang Lin and Dayiheng Liu and Linfeng Zhang},
journal= {arXiv preprint arXiv:2509.23873},
year = {2026}
}
备注
26 pages, 9 figures, 15 tables