中文

对抗攻击的归因与交互解释

机器学习 2021-08-17 v1 人工智能 计算机视觉与模式识别

摘要

本文旨在从对抗扰动如何贡献于攻击任务的角度解释对抗攻击。我们基于 Shapley 值估计不同图像区域对攻击代价降低的归因。我们定义并量化对抗扰动像素之间的交互,并将整个扰动图分解为相对独立的扰动分量。扰动图的分解表明,对抗训练的 DNN 比正常训练的 DNN 在前景中具有更多扰动分量。此外,与正常训练的 DNN 相比,对抗训练的 DNN 拥有更多主要降低真实类别分数的分量。上述分析为理解对抗攻击提供了新见解。

关键词

引用

@article{arxiv.2108.06895,
  title  = {Interpreting Attributions and Interactions of Adversarial Attacks},
  author = {Xin Wang and Shuyun Lin and Hao Zhang and Yufei Zhu and Quanshi Zhang},
  journal= {arXiv preprint arXiv:2108.06895},
  year   = {2021}
}