中文

NAT:针对神经元进行攻击以提升对抗性可迁移性

计算机视觉与模式识别 2025-08-26 v1

摘要

可迁移性对抗性扰动的生成通常涉及训练一个生成器,以最大化单个来源模型中间层干净图像和对抗图像之间的嵌入分离。本文在此基础上引入了针对特定神经元的攻击 (NAT),一种旨在针对嵌入中特定神经元的方法。我们的方法的灵感来自观察到的:以前的层级优化往往不成比例地聚焦于表示相似概念的少数神经元,导致被攻击层的其他神经元影响甚微。NAT 将注意力从嵌入层级分离转向更根本、针对神经元的方法。我们发现,针对单个神经元有效地扰乱了神经网络的核心单元,为跨不同模型的可迁移性提供了共同基础。在 41 个多样化的 ImageNet 模型和 9 个细粒度模型上进行的大量实验表明,NAT 在跨模型和跨域设置下的愚笨率分别超过现有基线 14% 和 4%。此外,利用所训练生成器的互补攻击能力,我们仅通过 10 次查询即可实现惊人的愚笨率。我们的代码已公开:https://krishnakanthnakka.github.io/NAT/。

关键词

引用

@article{arxiv.2508.16937,
  title  = {NAT: Learning to Attack Neurons for Enhanced Adversarial Transferability},
  author = {Krishna Kanth Nakka and Alexandre Alahi},
  journal= {arXiv preprint arXiv:2508.16937},
  year   = {2025}
}

备注

Published at WACV 2025