PatchGuard:通过小感受野与掩蔽实现针对对抗补丁的可证明鲁棒防御
计算机视觉与模式识别
2021-04-01 v5 密码学与安全
机器学习
机器学习
摘要
局部对抗补丁旨在通过任意修改图像受限区域内的像素来诱导机器学习模型误分类。此类攻击可通过将对抗补丁附着于待误分类物体而在物理世界中实现,而防御此类攻击是一个未解决/开放问题。在本文中,我们提出了一个称为 PatchGuard 的通用防御框架,该框架能够针对局部对抗补丁在实现高可证明鲁棒性的同时保持高干净准确率。PatchGuard 的基石在于使用具有小感受野的 CNN 来对对抗补丁所破坏的特征数量施加上界。给定有界数量的被破坏特征,设计对抗补丁防御的问题就简化为设计安全特征聚合机制的问题。为此,我们提出了鲁棒掩蔽防御,可鲁棒地检测并掩蔽被破坏特征以恢复正确预测。值得注意的是,我们可以证明我们的防御针对威胁模型内任意 adversary 的鲁棒性。我们在 ImageNet、ImageNette(ImageNet 的 10 类子集)和 CIFAR-10 数据集上的广泛评估表明,我们的防御在可证明鲁棒准确率和干净准确率方面均达到了最先进的性能。
引用
@article{arxiv.2005.10884,
title = {PatchGuard: A Provably Robust Defense against Adversarial Patches via Small Receptive Fields and Masking},
author = {Chong Xiang and Arjun Nitin Bhagoji and Vikash Sehwag and Prateek Mittal},
journal= {arXiv preprint arXiv:2005.10884},
year = {2021}
}
备注
USENIX Security Symposium 2021; extended technical report