中文

基于扰动伪造的数据对抗检测

计算机视觉与模式识别 2025-03-06 v4 机器学习

摘要

对抗检测作为抵御对抗攻击的防御策略,旨在基于自然数据与对抗数据之间分布和噪声模式差异,识别并过滤出对抗数据。虽然先前的检测方法在检测基于梯度的对抗攻击方面取得了高性能,但基于生成模型的新型攻击(具有不平衡和各向异性噪声模式)则能轻易地逃避检测。更糟糕的是,这些技术的推断时间开销大且对未见攻击性能有限,使其在实际应用中不可行。本文探讨了对抗噪声分布之间的接近性关系,并展示了这些分布存在开放覆盖。通过训练对抗噪声分布的开放覆盖,可以开发出对各种类型未见攻击具有强大泛化性能的检测器。基于此洞见,我们提出了扰动伪造(Perturbation Forgery)策略,包括噪声分布扰动、稀疏掩码生成和伪对抗数据生成,以训练一个能够检测各种类型未见梯度-based、生成-based 和物理对抗攻击的检测器。在多个通用数据集和人脸数据集上进行的全面实验验证了我们方法的强大泛化能力。

关键词

引用

@article{arxiv.2405.16226,
  title  = {Detecting Adversarial Data using Perturbation Forgery},
  author = {Qian Wang and Chen Li and Yuchen Luo and Hefei Ling and Shijuan Huang and Ruoxi Jia and Ning Yu},
  journal= {arXiv preprint arXiv:2405.16226},
  year   = {2025}
}

备注

Accepted as a conference paper at CVPR 2025