中文

MeanSparse:通过均值中心化特征稀疏化实现后训练鲁棒性增强

计算机视觉与模式识别 2025-10-10 v3 密码学与安全 机器学习

摘要

我们提出一种简单而有效的方法,通过后处理对抗训练模型,以提高卷积神经网络和注意力机制神经网络对对抗样本的鲁棒性。我们的技术方法MeanSparse,将训练好的模型的激活函数级联,以新颖的算子对均值中心化特征向量进行稀疏化。这等价于减少特征在均值周围的变化,我们证明,这种减少的变化仅影响模型的实用性,却显著削弱对抗性扰动并降低攻击者的成功率。我们的实验表明,当应用于RobustBench排行榜中的顶级模型时,MeanSparse在CIFAR-10、CIFAR-100和ImageNet上的AutoAttack准确率分别达到新的鲁棒性纪录75.28%(从73.71%)、44.78%(从42.67%)和62.12%(从59.56%)。代码已公开于https://github.com/SPIN-UMass/MeanSparse

关键词

引用

@article{arxiv.2406.05927,
  title  = {MeanSparse: Post-Training Robustness Enhancement Through Mean-Centered Feature Sparsification},
  author = {Sajjad Amini and Mohammadreza Teymoorianfard and Shiqing Ma and Amir Houmansadr},
  journal= {arXiv preprint arXiv:2406.05927},
  year   = {2025}
}