中文

经典深度神经网络是否具有弱对抗鲁棒性?

计算机视觉与模式识别 2025-06-04 v1 机器学习

摘要

对抗攻击受到越来越多的关注,并且人们普遍认为经典深度神经网络(DNN)的对抗鲁棒性较弱。最常用的对抗防御方法——对抗训练,通过生成对抗样本并重新训练模型来提高 DNN 的对抗准确率。然而,对抗训练需要巨大的计算开销。本文受现有关于 DNN 各层输出特征聚类特性及前馈渐进式崩溃(Progressive Feedforward Collapse)现象的研究启发,提出了一种对抗样本检测与图像识别方法,该方法利用逐层特征构建特征路径,并计算样本特征路径与类中心特征路径之间的相关性。实验结果表明,该识别方法在带有 PFC 的 ResNet-20 上实现了 82.77% 的干净准确率和 44.17% 的对抗准确率。与具有 77.64% 干净准确率和 52.94% 对抗准确率的对抗训练方法相比,我们的方法在不依赖计算代价高昂的防御策略的情况下展现出了权衡优势。此外,在标准的 ResNet-18 上,我们的方法保持了这一优势,两项指标分别为 80.01% 和 46.1%。这一结果揭示了 DNN 内在的对抗鲁棒性,挑战了关于 DNN 对抗鲁棒性较弱的传统认知。

关键词

引用

@article{arxiv.2506.02016,
  title  = {Are classical deep neural networks weakly adversarially robust?},
  author = {Nuolin Sun and Linyuan Wang and Dongyang Li and Bin Yan and Lei Li},
  journal= {arXiv preprint arXiv:2506.02016},
  year   = {2025}
}