利用范数有界对抗鲁棒性引起的过度不变性
机器学习
2019-03-26 v1 密码学与安全
计算机视觉与模式识别
机器学习
摘要
对抗样本是为使模型误分类而精心构造的恶意输入。其最常见的实例“基于扰动的”对抗样本对输入引入改变,使其真实标签不变,却导致不同的模型预测。相反,“基于不变性的”对抗样本对输入插入改变,尽管底层输入标签已变,但模型预测不受影响。本文中,我们证明对基于扰动的对抗样本的鲁棒性不仅不足以实现一般鲁棒性,更糟的是,它还会增加模型对基于不变性的对抗样本的脆弱性。除解析构造外,我们实证研究了具有针对由范数约束的基于扰动的对抗者的最先进鲁棒性的视觉分类器。我们发起利用任务相关方向上过度模型不变性的攻击,能够在球内找到对抗样本。事实上,我们发现被训练为范数鲁棒的分类器比其未防御的对应模型更易受基于不变性的对抗样本攻击。过度不变性并不限于被训练为对基于扰动的范数对抗者鲁棒的模型。事实上,我们认为“对抗样本”一词被用于概括一系列模型局限性,其中部分可能尚未被发现。相应地,我们呼吁建立一套精确的定义,以对学习中这些缺陷进行分类并逐一解决。
引用
@article{arxiv.1903.10484,
title = {Exploiting Excessive Invariance caused by Norm-Bounded Adversarial Robustness},
author = {Jörn-Henrik Jacobsen and Jens Behrmannn and Nicholas Carlini and Florian Tramèr and Nicolas Papernot},
journal= {arXiv preprint arXiv:1903.10484},
year = {2019}
}
备注
Accepted at the ICLR 2019 SafeML Workshop