中文

潜在危险区:提炼统一注意力以实现跨架构黑盒攻击

机器学习 2025-09-24 v1 计算机视觉与模式识别

摘要

由于对模型内部信息的访问受限,黑盒对抗攻击仍然具有挑战性。现有方法通常依赖于特定的网络架构或需要大量查询,导致跨架构迁移性有限且查询成本高昂。为解决这些局限性,我们提出了 JAD,一个用于黑盒对抗攻击的潜在扩散模型框架。JAD 利用由卷积神经网络(CNN)和 Vision Transformer(ViT)模型提炼的注意力图引导的潜在扩散模型来生成对抗样本。通过聚焦跨架构普遍敏感的图像区域,该方法构造的对抗扰动能够在不同模型类型之间有效迁移。这种联合注意力蒸馏策略使 JAD 与架构无关,在多种模型上实现了卓越的攻击泛化能力。此外,扩散模型的生成特性通过减少对迭代查询的依赖,提高了对抗样本的生成效率。实验表明,与现有方法相比,JAD 在攻击泛化能力、生成效率和跨架构迁移性方面均有提升,为黑盒对抗攻击提供了一种有前景且有效的范式。

关键词

引用

@article{arxiv.2509.19044,
  title  = {Latent Danger Zone: Distilling Unified Attention for Cross-Architecture Black-box Attacks},
  author = {Yang Li and Chenyu Wang and Tingrui Wang and Yongwei Wang and Haonan Li and Zhunga Liu and Quan Pan},
  journal= {arXiv preprint arXiv:2509.19044},
  year   = {2025}
}