中文

物理世界中不可察觉的对抗样本

计算机视觉与模式识别 2024-11-26 v1 人工智能

摘要

针对深度学习计算机视觉模型的数字域对抗样本允许对人类感官不可察觉的扰动。然而,由于视觉感知系统中不可导数的图像失真函数,难以在物理世界中生成类似的对抗样本。现有生成物理可实现对抗样本的算法通常通过允许无界扰动来松化对抗样本的定义,导致明显甚至奇异的视觉模式。本文通过使用直通估计器(STE,亦称BPDA),实现物理世界中对抗样本的不可察觉。我们采用STE来克服不可导性——在反向传播步骤中对前向传播应用确切的不可导失真,并在反向传播中使用恒等函数。我们的可微渲染扩展也使物理世界中的不可察觉对抗性补丁成为可能。通过打印照片和CARLA仿真器中的实验,我们表明STE能够在非不可导失真下快速生成\ell_\infty受限的对抗样本。据我们所知,这是首个在物理世界中展示\ell_\infty范数受限且能使全局扰动威胁模型下的分类准确率为零、在补丁扰动威胁模型下使目标检测AP50接近零(4.22%4.22\%)的不可察觉对抗样本。我们呼吁社区重新评估物理世界中对抗样本的威胁。

关键词

引用

@article{arxiv.2411.16622,
  title  = {Imperceptible Adversarial Examples in the Physical World},
  author = {Weilin Xu and Sebastian Szyller and Cory Cornelius and Luis Murillo Rojas and Marius Arvinte and Alvaro Velasquez and Jason Martin and Nageen Himayat},
  journal= {arXiv preprint arXiv:2411.16622},
  year   = {2024}
}