基于不确定性的语义分割中对抗攻击检测
计算机视觉与模式识别
2025-11-27 v2
摘要
最先进的深度神经网络已被证明在包括语义图像分割在内的广泛任务中非常强大。然而,这些网络易受对抗攻击的影响,即向输入图像添加不可感知的扰动从而导致错误预测,这在自动驾驶等安全关键应用中是危险的。对抗样本与防御策略在图像分类任务中已被充分研究,而在语义分割领域的研究有限。但初步工作表明,分割结果可能被对抗攻击严重扭曲。在本工作中,我们提出一种基于不确定性的语义分割对抗攻击检测方法。我们观察到,不确定性(例如由输出分布的熵所刻画)在干净图像与扰动图像上表现不同,并利用该性质区分这两种情况。我们的方法以轻量且后处理的方式工作,即我们不修改模型,也不需要知道用于生成对抗样本的过程。在详尽的实证分析中,我们证明了我们的方法能够跨多种对抗攻击类型检测扰动图像。
引用
@article{arxiv.2305.12825,
title = {Uncertainty-based Detection of Adversarial Attacks in Semantic Segmentation},
author = {Kira Maag and Asja Fischer},
journal= {arXiv preprint arXiv:2305.12825},
year = {2025}
}