对抗鲁棒性的统一博弈论解释
机器学习
2021-11-09 v2 人工智能
计算机视觉与模式识别
摘要
本文提供了一种统一的视角来解释不同的对抗攻击与防御方法,即DNNs输入变量间的多阶交互视角。基于多阶交互,我们发现对抗攻击主要通过影响高阶交互来欺骗DNN。此外,我们发现对抗训练得到的DNN的鲁棒性来源于类别特定的低阶交互。我们的发现提供了一种统一对抗扰动与鲁棒性的潜在方法,能够以原理性的方式解释现有的防御方法。此外,我们的发现也修正了先前关于对抗学习特征的形状偏置的不准确理解。
引用
@article{arxiv.2111.03536,
title = {A Unified Game-Theoretic Interpretation of Adversarial Robustness},
author = {Jie Ren and Die Zhang and Yisen Wang and Lu Chen and Zhanpeng Zhou and Yiting Chen and Xu Cheng and Xin Wang and Meng Zhou and Jie Shi and Quanshi Zhang},
journal= {arXiv preprint arXiv:2111.03536},
year = {2021}
}
备注
the previous version is arXiv:2103.07364, but I mistakenly apply a new ID for the paper