细察对抗样本的迁移性:它们如何以不同方式欺骗不同模型
机器学习
2022-10-21 v3 计算机视觉与模式识别
摘要
深度神经网络易受对抗样本(AEs)攻击,对抗样本具有对抗迁移性:为源模型生成的AEs能够误导另一(目标)模型的预测。然而,就目标模型的预测被误导至哪一类别(即类感知迁移性)而言,这种迁移性尚未被理解。在本文中,我们区分目标模型预测与源模型相同的错误类别(“相同错误”)或不同的错误类别(“不同错误”)的情况,以分析并解释其机制。我们发现:(1)AEs倾向于导致相同错误,这与“非定向迁移性”相关;然而,(2)即使在不同模型之间,无论扰动大小如何,也会发生不同错误。此外,我们提供的证据表明,相同错误与不同错误之间的差异可由非鲁棒特征(具有预测性但人类不可解释的模式)来解释:当模型以不同方式使用AEs中的非鲁棒特征时,就会发生不同错误。因此,非鲁棒特征能够为AEs的类感知迁移性提供一致的解释。
引用
@article{arxiv.2112.14337,
title = {Closer Look at the Transferability of Adversarial Examples: How They Fool Different Models Differently},
author = {Futa Waseda and Sosuke Nishikawa and Trung-Nghia Le and Huy H. Nguyen and Isao Echizen},
journal= {arXiv preprint arXiv:2112.14337},
year = {2022}
}
备注
25 pages, 13 figures, Accepted at the IEEE Winter Conference on Applications of Computer Vision (WACV) 2023