显著性攻击:面向不可感知的黑盒对抗攻击
机器学习
2022-06-07 v1 密码学与安全
计算机视觉与模式识别
摘要
深度神经网络易受对抗样本的攻击,即使在攻击者仅能访问模型输出的黑盒设定下亦然。近期研究已设计出具有高查询效率的有效黑盒攻击。然而,此类性能常伴随攻击不可感知性的妥协,阻碍了这些方法的实际使用。在本文中,我们提出将扰动限制在一个小的显著区域以生成几乎无法被察觉的对抗样本。该方法易于与许多现有黑盒攻击兼容,并能在攻击成功率轻微下降的情况下显著改善其不可感知性。进一步,我们提出了显著性攻击(Saliency Attack),一种旨在精炼显著区域内扰动以实现更佳不可感知性的新黑盒攻击。大量实验表明,与最先进的黑盒攻击相比,我们的方法取得了好得多的不可感知性分数,包括最明显失真(MAD)、 与 距离,并且在以类人 MAD 阈值为判据时获得了显著更高的成功率。重要的是,我们的方法生成的扰动在某种程度上是可解释的。最后,它还被证明对不同的基于检测的防御具有鲁棒性。
引用
@article{arxiv.2206.01898,
title = {Saliency Attack: Towards Imperceptible Black-box Adversarial Attack},
author = {Zeyu Dai and Shengcai Liu and Ke Tang and Qing Li},
journal= {arXiv preprint arXiv:2206.01898},
year = {2022}
}