中文

一种用于对抗性图像扰动的拟态检测器

计算机视觉与模式识别 2026-05-14 v2

摘要

对抗性攻击通过向干净图像添加微小、几乎不可见的噪声模式来欺骗深度图像分类器。标准的 \ell^\infty 有界攻击(FGSM、PGD 以及 Carlini--Wagner 的 \ell^\infty 变体)在像素级别产生高频、近乎随机的符号模式:在 2\ell^2 范数下几乎不可见,但携带不成比例的梯度能量。我们利用这一点,使用来自开源 MOLE 库的高阶 Corbino--Castillo 拟态算子,构建了一个单次、无需训练的检测器。无需重新训练,无需替代分类器,也无需访问受攻击的网络:判定结果仅取决于输入本身,计算复杂度为 O(HW)O(HW)。我们在标准 \texttt{peppers} 测试图像上,以典型的 \ell^\infty 预算 ε=16/255\varepsilon = 16/255 验证了该检测器,并观察到干净样本与对抗样本之间的分离度从 k=2k=2 阶时的 3.55×3.55\times 单调增长到 k=8k=8 阶时的 4.62×4.62\times

关键词

引用

@article{arxiv.2605.11492,
  title  = {A Mimetic Detector for Adversarial Image Perturbations},
  author = {Johnny Corbino},
  journal= {arXiv preprint arXiv:2605.11492},
  year   = {2026}
}

备注

v2: extended Table 1 with results for order $k=8$; minor revisions for clarity