一种用于识别对抗样本图像的通用度量
计算机视觉与模式识别
2018-07-30 v1 机器学习
摘要
众所周知,一个坚定的对手可以通过对图像施加难以察觉的对抗扰动来欺骗神经网络。近期研究表明,若事先知晓对手所采取的策略,即便没有神经网络的信息也能检测出这些扰动。遗憾的是,这些研究存在泛化性局限——每当对手改变策略,检测方法就必须重新校准。在本研究中,我们试图通过推导一种度量来克服泛化性局限,该度量能在对手所采用方法未知的情况下可靠地识别对抗图像。我们的度量利用将图像视为矩阵时干净图像与对抗图像频谱之间的关键差异。我们的度量能够跨不同数据集与攻击策略检测对抗图像,且无需任何额外重新校准。此外,我们的方法为若干关于对抗扰动的未解问题提供了几何层面的见解。
引用
@article{arxiv.1807.10335,
title = {A general metric for identifying adversarial images},
author = {Siddharth Krishna Kumar},
journal= {arXiv preprint arXiv:1807.10335},
year = {2018}
}