中文

通过稀疏对抗攻击实现可解释性对抗样本

机器学习 2025-06-24 v1 人工智能

摘要

稀疏攻击旨在优化对抗扰动的幅度,以欺骗深度神经网络 (DNN),仅涉及少数被扰动像素 (即在 l0 约束下),适用于解释 DNN 的脆弱性。然而,现有的解决方案因稀疏性差而无法生成可解释的对抗样本。更糟的是,它们常常面临计算开销大、迁移性差和攻击力弱的问题。本文旨在通过最小化初始扰动的幅度(在 l0 约束下),开发一种稀疏攻击,以理解 CNN 的脆弱性,克服现有缺陷,同时实现快速、可迁移且强大的针对 DNN 的攻击。具体而言,引入一种新型且理论严谨的参数化技术,用于近似 NP-hard l0 优化问题,使直接优化稀疏扰动在计算上变得可行。此外,设计了一种新型损失函数,以同时最大化对手属性和最小化被扰动像素的数量来增强初始扰动。开展大量实验表明,我们的方法在计算开销、迁移性和攻击力方面均优于最先进的稀疏攻击,凭借理论性能保证,预期作为评估 DNN 鲁棒性的基准。此外,理论和实证结果验证,我们的方法产生稀疏对抗样本,使我们能够发现两种噪声类别,即“遮蔽噪声”和“引导噪声”,有助于解释对抗扰动如何误导分类器进行错误预测。我们的代码已公开于 https://github.com/fudong03/SparseAttack。

关键词

引用

@article{arxiv.2506.17250,
  title  = {Towards Interpretable Adversarial Examples via Sparse Adversarial Attack},
  author = {Fudong Lin and Jiadong Lou and Hao Wang and Brian Jalaian and Xu Yuan},
  journal= {arXiv preprint arXiv:2506.17250},
  year   = {2025}
}