中文

深度学习模型脆弱,但对抗样本更为脆弱

计算机视觉与模式识别 2025-11-10 v1 人工智能

摘要

理解对抗样本与干净样本之间的内在差异,对于增强深度神经网络的鲁棒性和对抗攻击检测至关重要。本研究首先经验性地发现,基于图像的对抗样本对遮挡极其敏感。使用CIFAR-10上的九种标准攻击(如FGSM、PGD)生成对抗样本,并与原始样本配对进行评估。我们引入滑动遮挡置信熵(SMCE)来量化模型在遮挡下的置信度波动。通过1800多张测试图像的SMCE计算(支持遮挡熵场图和统计分布),表明对抗样本在遮挡下的置信度波动显著高于原始样本。基于此,我们提出基于滑动窗口遮挡的对抗样本检测方法(SWM-AED),该方法避免了传统对抗训练的灾难性过拟合。在CIFAR-10上的分类器和攻击评估表明,该方法表现稳健,准确率大多数情况下超过62%,最高可达96.5%。

关键词

引用

@article{arxiv.2511.05073,
  title  = {Deep learning models are vulnerable, but adversarial examples are even more vulnerable},
  author = {Jun Li and Yanwei Xu and Keran Li and Xiaoli Zhang},
  journal= {arXiv preprint arXiv:2511.05073},
  year   = {2025}
}

备注

25 pages,12 figures