关于 $L_p$-范数用于生成和防御对抗样本适用性
密码学与安全
2018-07-30 v3 计算机视觉与模式识别
摘要
大量研究工作致力于更好地理解对抗样本——即专门构造的机器学习模型输入,它们在感知上类似于良性输入,却被分类为不同类别(即被误分类)。生成对抗样本的算法和防御策略通常都使用 -范数来度量对抗输入与其良性原版之间的感知相似性。然而,已有先前工作表明,按 -范数度量,两幅图像未必彼此接近才具有感知相似性。在本工作中,我们表明按 -范数的接近性不仅对于感知相似性是不必要的,而且也是不充分的。具体地,聚焦于先前工作中使用的数据集(CIFAR10 和 MNIST)、-范数和阈值,我们通过在线用户研究表明,比常用 -范数阈值要求更接近于其良性对应物的“对抗样本”,在人类感知上仍可与相应良性样本不同。亦即,按 -范数“接近”的两幅图像之间的感知距离可以高到参与者频繁地将两幅图像分类为表示不同物体或数字。结合先前工作,我们由此证明按 -范数度量的输入接近性对于感知相似性既非必要也非充分,这对生成和防御对抗样本均有启示。我们提出并讨论了替代相似性度量,以激发该领域的未来研究。
引用
@article{arxiv.1802.09653,
title = {On the Suitability of $L_p$-norms for Creating and Preventing Adversarial Examples},
author = {Mahmood Sharif and Lujo Bauer and Michael K. Reiter},
journal= {arXiv preprint arXiv:1802.09653},
year = {2018}
}
备注
Appeared in CV-COPS/CVPRW 2018