中文

动态数据剪枝的批量损失得分

机器学习 2026-04-07 v1 计算机视觉与模式识别

摘要

动态数据剪枝通过在训练期间选择性地省略较少信息的样本来加速深度学习。虽然每个样本的损失是常见的重要性度量,但获取它可能在复杂模型或损失函数中具有挑战性或不可行,往往需要相当大的实现工作量。本文提出了批量损失得分 (BLS),一种使用易获得的批量损失的指数移动平均 (EMA) 来为单个样本分配得分的计算效率更高的替代方案。我们从单个样本的角度将批量损失视为其缩放后个人损失的噪声测量,噪声源自随机批量组成。形式地表明,EMA 机制作为一阶低通滤波器,衰减了高频批量组成噪声。这导致得分近似于平滑且持久的单个样本对损失的贡献,为 BLS 作为样本重要性的代理提供了理论依据。BLS 在代码集成方面表现出惊人的简单性(\textbf{三行注入}),并且能够无缝地适应现有的基于每个样本损失的方法(\textbf{一线代理})。其有效性通过在 \textbf{14} 个数据集、\textit{11} 项任务和 \textit{18} 个模型上无损剪枝 \textbf{20\%}-\textbf{50\%} 的样本来实现,凸显了其实用性和广泛适用性,尤其是在难以访问每个样本损失的复杂场景中。代码已在 https://github.com/mrazhou/BLS 上提供。

关键词

引用

@article{arxiv.2604.04681,
  title  = {Batch Loss Score for Dynamic Data Pruning},
  author = {Qing Zhou and Bingxuan Zhao and Tao Yang and Hongyuan Zhang and Junyu Gao and Qi Wang},
  journal= {arXiv preprint arXiv:2604.04681},
  year   = {2026}
}

备注

CVPR2026 accepted