针对图像分类器补丁攻击的高效认证防御
机器学习
2021-02-09 v1 人工智能
计算机视觉与模式识别
机器学习
摘要
对抗补丁通过自主系统的感知组件构成了针对物理世界攻击的现实威胁模型。因此,在自动驾驶等安全关键领域的自主系统应包含故障安全回退组件,该组件将针对补丁的可认证鲁棒性与高效推理相结合,同时在干净输入上保持高性能。我们提出 BagCert,一种模型架构与认证过程的新型组合,可实现高效认证。我们推导了一种损失,使得能够端到端优化针对不同大小和位置的补丁的认证鲁棒性。在 CIFAR10 上,BagCert 在单个 GPU 上以 43 秒认证 10,000 个样本,并获得 86% 的干净准确率和针对 5x5 补丁的 60% 认证准确率。
引用
@article{arxiv.2102.04154,
title = {Efficient Certified Defenses Against Patch Attacks on Image Classifiers},
author = {Jan Hendrik Metzen and Maksym Yatsura},
journal= {arXiv preprint arXiv:2102.04154},
year = {2021}
}
备注
accepted at ICLR 2021