中文

联合通用对抗扰动及其解释

密码学与安全 2024-08-06 v1 人工智能

摘要

深度神经网络 (DNN) 显著性地提升了许多艰巨任务的性能。尽管发展迅速,但 DNN 也暴露了其脆弱性。最近的研究表明,敌对者可以通过对良性样本添加通用对抗扰动 (universal adversarial perturbation, UAP) 来操控 DNN 的预测。另一方面,越来越多的努力被用于帮助用户通过突出显示样本中最具信息性的部分 (即归因图) 相对于其预测来理解和解释 DNN 的内部工作。我们首次发现,良性样本和对抗样本之间的归因图存在显著差异,这可能用于检测通用对抗扰动以对抗对抗攻击。此发现促使我们进一步调查一个新问题:是否存在能够同时攻击 DNN 分类器及其解释的通用对抗扰动,以实现恶意目的?由于这两个目标看似冲突,给出明确答案具有挑战性。本文提出一种新颖的攻击框架,用于生成联合通用对抗扰动 (joint universal adversarial perturbations, JUAP),该方法能够同时蒙蔽 DNN 模型并误导解释者的检查。在多个数据集上进行的全面实验表明,所提出的方法 JUAP 对联合攻击有效。据我们所知,这是首次研究针对同时攻击 DNN 和解释的 UAP。

关键词

引用

@article{arxiv.2408.01715,
  title  = {Joint Universal Adversarial Perturbations with Interpretations},
  author = {Liang-bo Ning and Zeyu Dai and Wenqi Fan and Jingran Su and Chao Pan and Luning Wang and Qing Li},
  journal= {arXiv preprint arXiv:2408.01715},
  year   = {2024}
}