PatchGuard++:针对对抗补丁的高效可证明攻击检测
计算机视觉与模式识别
2021-04-27 v1
摘要
对抗补丁可在受限区域内任意操纵图像像素以诱导模型误分类。由于攻击者可通过在受害物体上附加补丁发起物理可实现的攻击,这种局部攻击的威胁已引起显著关注。近期的可证明鲁棒防御通常遵循 PatchGuard 框架,使用具有小感受野的 CNN 与安全的特征聚合来实现鲁棒模型预测。在本文中,我们将 PatchGuard 扩展为 PatchGuard++,用于可证明地检测对抗补丁攻击,以提升可证明鲁棒准确率与干净准确率。在 PatchGuard++ 中,我们首先使用具有小感受野的 CNN 进行特征提取,从而限制对抗补丁所破坏的特征数量。接着,我们在特征空间中施加掩码,并对所有可能的掩码特征图评估预测。最后,我们从所有掩码预测中提取一种模式以捕捉对抗补丁攻击。我们在 ImageNette(ImageNet 的 10 类子集)、ImageNet 和 CIFAR-10 上评估 PatchGuard++,结果表明 PatchGuard++ 显著提升了可证明鲁棒性与干净性能。
引用
@article{arxiv.2104.12609,
title = {PatchGuard++: Efficient Provable Attack Detection against Adversarial Patches},
author = {Chong Xiang and Prateek Mittal},
journal= {arXiv preprint arXiv:2104.12609},
year = {2021}
}
备注
ICLR 2021 Workshop on Security and Safety in Machine Learning Systems