预测不一致有助于实现对对抗样本的通用检测
密码学与安全
2025-06-05 v1
摘要
对抗检测通过拒绝可疑测试样本来保护模型免受对抗攻击。然而,当前检测方法常常存在较弱的泛化性:其有效性在应用于对抗训练模型时会显著下降,而且通常难以在白盒和黑盒攻击设置下实现一致的效果。本文发现,一个与主模型在训练策略或模型架构上不同的辅助模型,倾向于对主模型在对抗样本上的预测赋予低置信度,而在正常样本上保持高置信度。基于此发现,我们提出了预测不一致检测器(PID),这是一种轻量且通用的检测框架,通过捕获主模型和辅助模型之间的预测不一致来区分对抗样本和正常样本。PID 与自然训练和对抗训练的主模型兼容,并在 3 个白盒、3 个黑盒和 1 个混合对抗攻击中超越了 4 个检测方法。具体而言,PID 在 CIFAR-10 上当主模型为自然训练时平均 AUC 为 99.29%,对抗训练时为 99.30%;在 ImageNet 上分别为 98.31% 和 96.81%,超越现有 SOTA 高出 4.70%~25.46%。
引用
@article{arxiv.2506.03765,
title = {Prediction Inconsistency Helps Achieve Generalizable Detection of Adversarial Examples},
author = {Sicong Han and Chenhao Lin and Zhengyu Zhao and Xiyuan Wang and Xinlei He and Qian Li and Cong Wang and Qian Wang and Chao Shen},
journal= {arXiv preprint arXiv:2506.03765},
year = {2025}
}