基于移出一样本的数据剪枝
机器学习
2023-10-26 v2 人工智能
计算机视觉与模式识别
摘要
本文提出一种称为移出一样本(MoSo)的新型数据剪枝方法,旨在识别并移除训练集中信息量最少的样本。MoSo 的核心见解是通过评估每个样本对最优经验风险的影响来确定其重要性。这是通过测量当特定样本从训练集中排除时经验风险的变化程度来实现的。我们未使用计算昂贵的留一重训练过程,而是提出一种高效的一阶近似器,仅需来自不同训练阶段的梯度信息。我们近似背后的关键思想是:梯度与训练集平均梯度持续对齐的样本信息量更大且应获更高分数,这可直观理解为:若某样本的梯度与平均梯度向量一致,则意味着使用该样本优化网络将对所有剩余样本产生类似效果。实验结果表明,MoSo 有效缓解了高剪枝比例下的严重性能退化,并在多种设置下取得令人满意的性能。
引用
@article{arxiv.2310.14664,
title = {Data Pruning via Moving-one-Sample-out},
author = {Haoru Tan and Sitong Wu and Fei Du and Yukang Chen and Zhibin Wang and Fan Wang and Xiaojuan Qi},
journal= {arXiv preprint arXiv:2310.14664},
year = {2023}
}
备注
Accepted by the Thirty-seventh Conference on Neural Information Processing Systems (NeurIPS 2023)