中文

具身主动防御:利用循环反馈对抗对抗性补丁

计算机视觉与模式识别 2024-04-02 v1 人工智能

摘要

深度神经网络对对抗性补丁的脆弱性促使了大量提升模型鲁棒性的防御策略。然而,现有的防御依赖于单次观察或预设的对抗信息来对抗对抗性补丁,在面对未见或自适应的对抗攻击时往往失效,且在动态 3D 环境中容易表现出不理想的性能。受人类主动感知和循环反馈机制的启发,我们开发了具身主动防御(EAD),这是一种主动防御策略,主动将环境信息情境化,以解决 3D 真实世界环境中错位的对抗性补丁。为此,EAD 开发了两个核心循环子模块,即感知模块和策略模块,以实现主动视觉的两个关键功能。这些模型循环处理一系列信念和观察,促进对目标物体理解的逐步细化,并使得能够制定策略性行动以对抗 3D 环境中的对抗性补丁。为了优化学习效率,我们引入了环境动力学的可微近似,并部署了对对抗策略不可知的补丁。大量实验表明,在安全关键任务(例如,人脸识别和目标检测)中,EAD 通过其行动策略在仅几步内就大幅增强了对各种补丁的鲁棒性,且未牺牲标准精度。此外,由于攻击不可知的特性,EAD 对未见攻击表现出出色的泛化能力,在一系列未见对抗攻击中将平均攻击成功率降低了 95%。

关键词

引用

@article{arxiv.2404.00540,
  title  = {Embodied Active Defense: Leveraging Recurrent Feedback to Counter Adversarial Patches},
  author = {Lingxuan Wu and Xiao Yang and Yinpeng Dong and Liuwei Xie and Hang Su and Jun Zhu},
  journal= {arXiv preprint arXiv:2404.00540},
  year   = {2024}
}

备注

27pages