可证明对抗鲁棒的最近原型分类器
机器学习
2022-07-18 v1
摘要
最近原型分类器(NPC)根据所选距离度量将每个输入点分配给最近原型的标签。NPC 的一个直接优势是其决策可解释。先前的工作在使用相同 距离作为 NPC 时,能够提供最小对抗扰动在 威胁模型下的下界。在本文中,我们针对 ,在使用 距离进行决策、使用 威胁模型进行认证的复杂度问题给出了完整讨论。特别地,我们提供了在使用 距离时精确计算最小对抗扰动的可扩展算法,并在其他情况下改进了下界。利用高效的改进下界,我们训练了可证明对抗鲁棒的 NPC(PNPC),其在 MNIST 上比神经网络具有更好的 鲁棒性保证。此外,据我们所知,我们展示了首个针对 LPIPS 感知度量的认证结果,该度量被认为比 球更贴近图像分类的真实威胁模型。我们的 PNPC 在 CIFAR10 上的认证鲁棒准确率高于 (Laidlaw et al., 2021) 中报告的实证鲁棒准确率。代码可在我们的仓库中获取。
引用
@article{arxiv.2207.07208,
title = {Provably Adversarially Robust Nearest Prototype Classifiers},
author = {Václav Voráček and Matthias Hein},
journal= {arXiv preprint arXiv:2207.07208},
year = {2022}
}
备注
Accepted at ICML 2022