开箱即用的鲁棒性:组合式表征天然防御黑盒补丁攻击
计算机视觉与模式识别
2020-12-02 v1
摘要
基于补丁的对抗攻击对输入引入可感知但局部的改变以诱导误分类。虽然在防御不可感知攻击方面已取得进展,但如何抵御基于补丁的攻击仍不明确。在这项工作中,我们研究了两种抵御黑盒补丁攻击的方法。首先,我们表明在不可感知攻击上成功的对抗训练,对最先进的位置优化补丁攻击效果有限。其次,我们发现具有基于部件表征、从而对自然遮挡具有先天鲁棒性的组合式深度网络,在PASCAL3D+和德国交通标志识别基准上无需对抗训练即对补丁攻击鲁棒。此外,组合式模型的鲁棒性大幅优于对抗训练的标准模型。然而,在GTSRB上,我们观察到它们难以区分具有细粒度差异的相似交通标志。我们通过引入基于部件的微调来克服此限制,从而改善细粒度识别。通过利用组合式表征,这是首项无需昂贵对抗训练即可防御黑盒补丁攻击的工作。该防御比对抗训练更鲁棒且更具可解释性,因为它能定位并忽略对抗补丁。
引用
@article{arxiv.2012.00558,
title = {Robustness Out of the Box: Compositional Representations Naturally Defend Against Black-Box Patch Attacks},
author = {Christian Cosgrove and Adam Kortylewski and Chenglin Yang and Alan Yuille},
journal= {arXiv preprint arXiv:2012.00558},
year = {2020}
}