Protego:基于 Transformer 内在能力检测视觉 Transformer 的对抗样本
计算机视觉与模式识别
2025-01-14 v1 机器学习
摘要
Transformer 模型在自然语言任务中取得了卓越的成绩,促使视觉社区探索其在计算机视觉问题中的实现。然而,这些模型仍受对抗样本的影响。本文调查了六种常见对抗攻击对三个预训练 ViT 模型的攻击能力,以揭示 ViT 模型的脆弱性。为理解和分析当输入为对抗样本时神经网络决策中的偏差,我们使用两种可视化技术,即注意力滚动和梯度注意力滚动。为防止 ViT 模型受到对抗攻击,我们提出了 Protego,一个利用 Transformer 内在能力检测 ViT 模型对抗样本的检测框架。尽管如此,这仍然具有挑战性,因为对手可能采用多样的攻击策略。受注意力机制启发,我们知道预测的 token 包含来自输入样本的所有信息。此外,对抗样本的注意力区域不同于正常样本的注意力区域。基于这些观察,我们可以训练一个检测器,实现的性能优于现有的检测方法,以识别对抗样本。我们的实验表明,我们的检测方法效果显著。对于这六种对抗攻击方法,我们的检测器的 AUC 分数均超过 0.95。Protego 可能推动元宇宙安全的研究。
关键词
引用
@article{arxiv.2501.07044,
title = {Protego: Detecting Adversarial Examples for Vision Transformers via Intrinsic Capabilities},
author = {Jialin Wu and Kaikai Pan and Yanjiao Chen and Jiangyi Deng and Shengyuan Pang and Wenyuan Xu},
journal= {arXiv preprint arXiv:2501.07044},
year = {2025}
}
备注
Accepted by IEEE MetaCom 2024