PUMA:基于间隔的数据剪枝
机器学习
2024-05-13 v1
摘要
深度学习在许多任务中的分类准确率已能超越人类。然而,为了实现对对抗性扰动的鲁棒性,最佳方法需要在通常已使用生成模型(如扩散模型)大幅扩充的更大训练集上进行对抗训练。本工作的主要目标是在保持相同或更优的准确率-鲁棒性权衡的同时,减少这些数据需求。我们聚焦于数据剪枝,即根据样本到模型分类边界(即间隔)的距离移除部分训练样本。我们发现,当添加大量合成数据时,现有剪除低间隔样本的方法未能提升鲁棒性,并通过一个感知器学习任务解释了这一现象。此外,我们发现为追求更高准确率而剪除高间隔样本,会加剧对抗训练中错误标记的扰动数据的有害影响,同时损害鲁棒性和准确率。因此,我们提出 PUMA,一种新的数据剪枝策略,它使用 DeepFool 计算间隔,并通过联合调整低间隔样本上的训练攻击范数,在不损害性能的前提下剪除最高间隔的训练样本。我们证明,PUMA 可应用于当前最先进的鲁棒性方法之上,并且与现有数据剪枝策略不同,它能显著提升模型性能。PUMA 不仅能用更少的数据达到相似的鲁棒性,还能显著提高模型准确率,从而改善性能权衡。
引用
@article{arxiv.2405.06298,
title = {PUMA: margin-based data pruning},
author = {Javier Maroto and Pascal Frossard},
journal= {arXiv preprint arXiv:2405.06298},
year = {2024}
}