中文

基于显著区域与加权特征丢弃的定向对抗样本可迁移性增强

信息检索 2024-11-12 v1

摘要

深度神经网络可能受到对抗样本的攻击,对实际应用构成重大风险。一种常见的对抗攻击方法依赖于对抗样本的可迁移性,即从替代模型生成对抗样本并利用其攻击未知黑箱模型。尽管已有多种方法旨在提升可迁移性,但这些攻击在定向黑箱场景中的成功率常因对抗样本对替代模型的过拟合而受限。本文提出了一种基于显著区域与加权特征丢弃 (Salient region & Weighted Feature Drop, SWFD) 的新型框架,旨在增强对抗样本的定向可迁移性。基于对高可迁移性样本在深层输出中具有更平滑分布的观察,我们提出加权特征丢弃机制,根据按范数分布缩放的权重来调节激活值,从而有效缓解生成对抗样本时的过拟合问题。此外,通过利用图像中的显著区域构建辅助图像,我们的方法能够以模型无关的方式将对抗样本的特征迁移至目标类别,从而增强可迁移性。全面的实验证实,我们的方法在多种配置下均优于现有最先进方法。平均而言,所提出的 SWFD 将正常训练模型和鲁棒模型上的攻击成功率分别提升了 16.31% 和 7.06%。

关键词

引用

@article{arxiv.2411.06784,
  title  = {Boosting the Targeted Transferability of Adversarial Examples via Salient Region & Weighted Feature Drop},
  author = {Shanjun Xu and Linghui Li and Kaiguo Yuan and Bingyu Li},
  journal= {arXiv preprint arXiv:2411.06784},
  year   = {2024}
}

备注

9 pages