利用L0对抗样本的固有局限性
密码学与安全
2019-08-01 v3
摘要
尽管神经网络在图像分类等任务上取得了巨大成就,它们却脆弱且易受热对抗样本(AE)攻击——通过在输入上添加人类难以察觉的扰动以使基于神经网络的分类器错误标注。特别地,L0 AE是一类被广泛讨论的威胁,其中攻击者在其可破坏的像素数量上受限。然而,我们的观察是,虽然L0攻击尽可能少地修改像素,它们往往对修改后的像素造成大幅度的扰动。我们将此视为L0 AE的固有局限性,并通过检测与纠正此类攻击来挫败之。所提检测器的主要新颖之处在于,我们利用L0攻击的固有局限性将AE检测问题转化为一个比较问题。更具体地,给定图像I,对其预处理得到另一图像I'。已知在比较中有效的连体网络(Siamese network)将I与I'作为输入对以判定I是否为AE。训练好的连体网络自动且精确地捕捉I与I'之间的差异以检测L0扰动。此外,我们展示了用于检测的预处理技术——修复(inpainting)——也可作为一种有效防御,其有高概率去除L0扰动的对抗影响。因此,我们的系统AEPECKER不仅展现出高AE检测准确率,也具备纠正分类结果的显著能力。
引用
@article{arxiv.1812.09638,
title = {Exploiting the Inherent Limitation of L0 Adversarial Examples},
author = {Fei Zuo and Bokai Yang and Xiaopeng Li and Lannan Luo and Qiang Zeng},
journal= {arXiv preprint arXiv:1812.09638},
year = {2019}
}
备注
Accepted by the 22nd International Symposium on Research in Attacks, Intrusions and Defenses (RAID 2019)