PASA:基于预测与归因灵敏度分析的攻击无关无监督对抗检测
密码学与安全
2024-08-28 v1 人工智能
机器学习
摘要
深度神经网络在分类任务中易受到对抗攻击的威胁,攻击者通过对输入样本施加微小扰动即可导致模型产生错误预测。这种脆弱性以及神经网络的黑箱特性,限制了其在自动驾驶等关键应用场景的部署。特征归因方法通过量化输入特征对模型预测的重要性,从而解释模型决策。然而我们发现,模型预测和特征归因对噪声敏感。本文针对这一特性,开发了一种实用方法用于检测对抗样本。我们提出的PASA方法无需监督信号,仅需计算两个基于模型预测与特征归因的统计量,并通过从良性样本中学习的阈值即可可靠地检测对抗样本。我们在多个图像和非图像数据集上评估了PASA在不同强度的FGSM、PGD、BIM和CW攻击下的性能。平均而言,PASA在CIFAR-10和ImageNet上的ROC-AUC分数分别比当前最先进的统计无监督对抗检测器高出14%和35%。此外,我们的方法即使对抗者了解防御机制,也表现出竞争性能。
引用
@article{arxiv.2404.10789,
title = {PASA: Attack Agnostic Unsupervised Adversarial Detection using Prediction & Attribution Sensitivity Analysis},
author = {Dipkamal Bhusal and Md Tanvirul Alam and Monish K. Veerabhadran and Michael Clifford and Sara Rampazzi and Nidhi Rastogi},
journal= {arXiv preprint arXiv:2404.10789},
year = {2024}
}
备注
9th IEEE European Symposium on Security and Privacy