中文

Protego:基于 Transformer 内在能力检测视觉 Transformer 的对抗样本

计算机视觉与模式识别 2025-01-14 v1 机器学习

摘要

Transformer 模型在自然语言任务中取得了卓越的成绩,促使视觉社区探索其在计算机视觉问题中的实现。然而,这些模型仍受对抗样本的影响。本文调查了六种常见对抗攻击对三个预训练 ViT 模型的攻击能力,以揭示 ViT 模型的脆弱性。为理解和分析当输入为对抗样本时神经网络决策中的偏差,我们使用两种可视化技术,即注意力滚动和梯度注意力滚动。为防止 ViT 模型受到对抗攻击,我们提出了 Protego,一个利用 Transformer 内在能力检测 ViT 模型对抗样本的检测框架。尽管如此,这仍然具有挑战性,因为对手可能采用多样的攻击策略。受注意力机制启发,我们知道预测的 token 包含来自输入样本的所有信息。此外,对抗样本的注意力区域不同于正常样本的注意力区域。基于这些观察,我们可以训练一个检测器,实现的性能优于现有的检测方法,以识别对抗样本。我们的实验表明,我们的检测方法效果显著。对于这六种对抗攻击方法,我们的检测器的 AUC 分数均超过 0.95。Protego 可能推动元宇宙安全的研究。

关键词

引用

@article{arxiv.2501.07044,
  title  = {Protego: Detecting Adversarial Examples for Vision Transformers via Intrinsic Capabilities},
  author = {Jialin Wu and Kaikai Pan and Yanjiao Chen and Jiangyi Deng and Shengyuan Pang and Wenyuan Xu},
  journal= {arXiv preprint arXiv:2501.07044},
  year   = {2025}
}

备注

Accepted by IEEE MetaCom 2024