不变性与对抗扰动敏感性之间的基本权衡
机器学习
2020-08-05 v2 密码学与安全
计算机视觉与模式识别
机器学习
摘要
对抗样本是为诱导误分类而精心构造的恶意输入。常被研究的基于敏感性的对抗样本对输入引入语义上微小的改变,从而导致不同的模型预测。本文研究一种互补的失败模式,即基于不变性的对抗样本,其引入最小语义改变以修改输入的真实标签却保持模型的预测不变。我们展示了这两类对抗样本之间的基本权衡。我们表明,针对基于敏感性攻击的防御会主动损害模型在基于不变性攻击上的准确性,并且需要新方法来抵抗这两类攻击。特别地,我们通过生成模型(可证明)鲁棒于的小扰动来攻破最先进的对抗训练与可认证鲁棒模型,而这些扰动根据人类标注者会改变输入的类别。最后,我们形式化地表明,过度不变分类器的存在源于标准数据集中存在过度鲁棒的预测特征。
引用
@article{arxiv.2002.04599,
title = {Fundamental Tradeoffs between Invariance and Sensitivity to Adversarial Perturbations},
author = {Florian Tramèr and Jens Behrmann and Nicholas Carlini and Nicolas Papernot and Jörn-Henrik Jacobsen},
journal= {arXiv preprint arXiv:2002.04599},
year = {2020}
}
备注
ICML 2020 (Supersedes the workshop paper "Exploiting Excessive Invariance caused by Norm-Bounded Adversarial Robustness", arXiv:1903.10484)