面向物理世界对抗攻击视觉自然度的基准构建与评估
计算机视觉与模式识别
2023-05-23 v1
摘要
物理世界对抗攻击是一种极具实用性与威胁性的攻击,其通过生成醒目且恶意构造的真实世界制品来欺骗真实世界的深度学习系统。在物理世界攻击中,自然度的评估被高度重视,因为人类可轻易检测并移除不自然的攻击。然而,当前研究以个案方式评估自然度,存在误差、偏倚与不一致性。本文中,我们迈出第一步,以自动驾驶场景为首次尝试,对物理世界攻击的视觉自然度进行基准构建与评估。首先,为基准化攻击自然度,我们贡献了首个带人类评分与注视的Physical Attack Naturalness (PAN)数据集。PAN首次验证了若干洞见:自然度受上下文特征(即环境与语义变化)的(差异性)影响,并与行为特征(即注视信号)相关。其次,为自动评估与人类评分一致的自然度,我们进一步引入Dual Prior Alignment (DPA)网络,旨在将人类知识嵌入模型推理过程。具体而言,DPA通过评分先验对齐模仿人类在自然度评估中的推理,并通过注意先验对齐模拟人类注视行为。我们希望我们的工作促进研究与提升并自动评估物理世界攻击的自然度。我们的代码与数据集见 https://github.com/zhangsn-19/PAN。
引用
@article{arxiv.2305.12863,
title = {Towards Benchmarking and Assessing Visual Naturalness of Physical World Adversarial Attacks},
author = {Simin Li and Shuing Zhang and Gujun Chen and Dong Wang and Pu Feng and Jiakai Wang and Aishan Liu and Xin Yi and Xianglong Liu},
journal= {arXiv preprint arXiv:2305.12863},
year = {2023}
}