中文

少量大偏移:基于层不一致性的最小开销对抗样本检测

机器学习 2025-10-03 v5

摘要

深度神经网络(DNN)高度易受对抗样本的攻击——这些是细微且难以察觉的扰动,可能导致预测错误。虽然检测性防御方法为对抗训练提供了实用替代方案,但许多现有方法依赖外部模型、复杂架构或对抗数据,限制了其效率和通用性。我们引入一种轻量级、可插拔的检测框架,利用目标模型内部的层级不一致性,仅需良好数据进行校准。我们的方法基于“少量大偏移假设”(A Few Large Shifts Assumption),该假设指出,对抗扰动会在少数少数层中引发大规模、局部的层次 Lipschitz 连续性违反。在此基础上,我们提出两种互补策略——恢复测试(Recovery Testing, RT)和逻辑层测试(Logit-layer Testing, LT)——来经验性地衡量这些违反,从而暴露由对手者造成的内部干扰。在 CIFAR-10、CIFAR-100 和 ImageNet 上,分别在标准和自适应威胁模型下进行评估,我们的方法在几乎零计算开销的同时实现了领先的检测性能。此外,我们的系统级分析提供了一种实际的方法,用于选择检测阈值,并对准确率提供形式下界保证。代码已公开:https://github.com/c0510gy/AFLS-AED。

关键词

引用

@article{arxiv.2505.12586,
  title  = {A Few Large Shifts: Layer-Inconsistency Based Minimal Overhead Adversarial Example Detection},
  author = {Sanggeon Yun and Ryozo Masukawa and Hyunwoo Oh and Nathaniel D. Bastian and Mohsen Imani},
  journal= {arXiv preprint arXiv:2505.12586},
  year   = {2025}
}