对抗性磨损:基于自然损伤生成物理世界对抗性样本
计算机视觉与模式识别
2026-02-10 v2 人工智能
机器学习
摘要
物理世界对抗性样本的存在对深度神经网络在自动驾驶等安全关键应用的部署构成重大挑战。现有大多数物理世界对抗性样本生成方法都依赖临时性修改(如阴影、激光束或贴纸),这些修改往往针对特定情景而设计。本文引入一种新的物理世界对抗性样本类别——AdvWT,灵感来自自然界中“磨损”现象,即物理对象固有的属性。不同于人工制作的扰动,“磨损”是随环境退化自然发生的,例如户外广告牌的渐进式损坏。为实现此目标,AdvWT 采用两步方法:首先,利用基于生成对抗网络 (GAN) 的无监督图像到图像翻译网络建模这些自然损伤,特别是在户外广告牌场景下。该翻译网络将损坏特征编码为潜在的“损伤风格码”。其次,引入对抗性扰动至风格码中, strategically 优化其转换过程。这种操作微妙地改变损伤风格表征,引导网络生成外观保持感官真实性的对抗性图像,同时确保其对神经网络产生误导作用。通过两个交通标志数据集的全面实验,表明 AdvWT 在数字和物理域均能有效误导 DNN。AdvWT 在攻击成功率、鲁棒性和自然外观方面均优于现有物理世界对抗性样本。此外,将 AdvWT 集成到训练中可提升模型对真实受损标志的泛化能力。
引用
@article{arxiv.2503.21164,
title = {Adversarial Wear and Tear: Exploiting Natural Damage for Generating Physical-World Adversarial Examples},
author = {Samra Irshad and Seungkyu Lee and Nassir Navab and Hong Joo Lee and Seong Tae Kim},
journal= {arXiv preprint arXiv:2503.21164},
year = {2026}
}
备注
Accepted to IEEE Transactions in Secure and Dependable Computing. This version corresponds to the author's accepted manuscript