最小化最大模型差异以实现可迁移的黑盒定向攻击
计算机视觉与模式识别
2022-12-20 v1 机器学习
摘要
在这项工作中,我们从模型差异的角度研究黑盒定向攻击问题。在理论方面,我们给出了黑盒定向攻击的泛化误差界,为保证攻击成功提供了严格的理论分析。我们揭示了目标模型上的攻击误差主要取决于替代模型上的经验攻击误差以及替代模型之间的最大模型差异。在算法方面,我们基于理论分析推导出一种新的黑盒定向攻击算法,其中我们在训练生成器生成对抗样本时,额外最小化替代模型的最大模型差异(M3D)。通过这种方式,我们的模型能够生成对模型变化具有鲁棒性的高度可迁移对抗样本,从而提高攻击黑盒模型的成功率。我们在 ImageNet 数据集上使用不同的分类模型进行了大量实验,我们提出的方法以显著优势超越了现有的最先进方法。我们的代码将予以公开。
引用
@article{arxiv.2212.09035,
title = {Minimizing Maximum Model Discrepancy for Transferable Black-box Targeted Attacks},
author = {Anqi Zhao and Tong Chu and Yahao Liu and Wen Li and Jingjing Li and Lixin Duan},
journal= {arXiv preprint arXiv:2212.09035},
year = {2022}
}