通过归一化Logit校准与截断特征混合提升可迁移定向对抗攻击
计算机视觉与模式识别
2024-05-13 v1
摘要
本文旨在提升定向攻击中对抗样本的可迁移性,目前此类攻击的成功率仍相对较低。为实现这一目标,我们从损失和特征两个层面提出了两种不同的技术来改进定向可迁移性。首先,在以往的方法中,用于定向攻击的logit校准主要关注样本中目标类别与非目标类别之间的logit间隔,忽略了logit的标准差。相比之下,我们引入了一种新的归一化logit校准方法,该方法同时考虑了logit间隔和logit的标准差。这种方法能有效校准logit,从而增强定向可迁移性。其次,先前的研究表明,在优化过程中混合干净样本的特征可以显著提高可迁移性。在此基础上,我们进一步研究了一种截断特征混合方法,以减少源训练模型的影响,从而带来额外的改进。截断特征是通过移除从干净样本的高层卷积层分解出的、与最大奇异值相关联的秩-1特征来确定的。在ImageNet-Compatible和CIFAR-10数据集上进行的大量实验证明了我们提出的两个组件各自及共同的益处,在黑盒定向攻击中,其性能大幅优于当前最先进的方法。
引用
@article{arxiv.2405.06340,
title = {Improving Transferable Targeted Adversarial Attack via Normalized Logit Calibration and Truncated Feature Mixing},
author = {Juanjuan Weng and Zhiming Luo and Shaozi Li},
journal= {arXiv preprint arXiv:2405.06340},
year = {2024}
}