中文

迈向弥合对抗样本经验鲁棒性与认证鲁棒性之间的鸿沟

机器学习 2022-08-02 v3 人工智能

摘要

当前针对对抗样本的最先进防御方法通常侧重于改进经验鲁棒性或认证鲁棒性之一。其中,对抗训练(AT)模型在不提供大型分类器或高维输入的鲁棒性保证的情况下,产生针对对抗样本的经验最先进防御。相比之下,现有的基于随机平滑的模型实现了最先进的认证鲁棒性,同时显著降低了针对对抗样本的经验鲁棒性。在本文中,我们提出了一种称为“通过自适应实现认证”(Certification through Adaptation)的新方法,该方法在推理时将 AT 模型转换为随机平滑分类器,从而为 2\ell_2 范数提供认证鲁棒性,且不影响其针对对抗攻击的经验鲁棒性。我们还提出了“自动噪声”(Auto-Noise)技术,可高效近似适当的噪声水平,以利用随机平滑技术灵活认证测试样本。我们提出的结合“自动噪声”技术的“通过自适应实现认证”在使用 AT 模型时,对 CIFAR-10 和 ImageNet 数据集分别实现了高达 1.1021.1021.1481.148 的平均认证半径(ACR)分数,且不影响其经验鲁棒性或良性精度。因此,我们的论文通过使用同一分类器同时实现两者,向弥合对抗样本经验鲁棒性与认证鲁棒性之间的鸿沟迈出了一步。

关键词

引用

@article{arxiv.2102.05096,
  title  = {Towards Bridging the gap between Empirical and Certified Robustness against Adversarial Examples},
  author = {Jay Nandy and Sudipan Saha and Wynne Hsu and Mong Li Lee and Xiao Xiang Zhu},
  journal= {arXiv preprint arXiv:2102.05096},
  year   = {2022}
}

备注

An abridged version of this work has been presented at ICLR 2021 Workshop on Security and Safety in Machine Learning Systems: https://aisecure-workshop.github.io/aml-iclr2021/papers/2.pdf