中文

SLAP:基于分层损失的策略数据高效指令调优剪枝

计算与语言 2026-05-26 v1

摘要

指令调优已优化大型语言模型(LLM)的专用能力,但通常需要大量数据集和长时间的训练。挑战在于通过识别有用数据并高效微调来开发特定能力。高质量且多样化的剪枝数据可帮助模型以更低成本实现无损性能。本文提出了‛**SLAP**(Stratified Loss-based Pruning),一种评估整个批次组成而非单个样本可学习性的批次感知数据选择框架。SLAP 通过分布感知的分层抽样确保数据分布覆盖,同时通过相对距离优化最大化批内多样性。利用海森矩阵近似梯度信息进行动态批选择,SLAP 在多个模型架构(LLaMA、ChatGLM)和多样化下游任务(多轮对话、多语言翻译、问答)上显著优于现有最先进方法。最突出的是,SLAP 在使用 20-40% 更少训练数据的情况下即可实现优异性能,大幅降低计算成本,同时保持或提升模型能力。这些结果表明,SLAP 是大型语言模型高效且有效指令调优的强大方法。

关键词

引用

@article{arxiv.2605.23969,
  title  = {SLAP: Stratified Loss-based Pruning for On-Policy Data-Efficient Instruction Tuning},
  author = {Run Zou and Jianhang Ding and Yifan Ding and Wen Wu and Hao Chen and Renshu Gu},
  journal= {arXiv preprint arXiv:2605.23969},
  year   = {2026}
}

备注

15 pages, 10 figures