中文

对抗脆弱性超越计算范式:特征工程无法抵御神经网络对抗迁移

机器学习 2026-01-30 v1 人工智能 计算机视觉与模式识别

摘要

深度神经网络面临对抗样本的威胁——输入数据经过不可感知的扰动会导致误分类。虽然神经网络内部已广泛记录对抗样本的迁移现象,但经典机器学习管道使用手工特征是否继承这种脆弱性尚未探讨。特征工程通过梯度量化和空间分箱创建信息瓶颈,可能过滤掉高频对抗信号。我们通过对抗从 DNN 迁移到 HOG 基于分类器的首次全面研究来评估这一假设。使用 VGG16 作为替代模型,生成 FGSM 和 PGD 对抗样本并测试其在 CIFAR-10 上八种 HOG 配置下的四个经典分类器 (KNN、决策树、线性 SVM、核 SVM) 和一个浅层神经网络。我们的结果强有力地否定了保护性假设:所有分类器均遭受 16.6%-59.1% 的相对准确率下降,与神经网络间的迁移相当。更令人惊讶的是,我们发现攻击层次结构的逆转——与迭代 PGD 在神经网络内部占主导、FGSM 次之的模式不同,FGSM 在 100% 的经典机器学习案例中导致更大程度的性能下降,这表明迭代攻击过度拟合到替代模型的特定特征,而这些特征在特征提取后并未存活。块归一化提供了部分但不充分的缓解。这些发现表明,对抗脆弱性并非端到端可微性的副作用,而是图像分类系统的基本属性,对安全关键部署跨计算范式都有深远含义。

引用

@article{arxiv.2601.21323,
  title  = {Adversarial Vulnerability Transcends Computational Paradigms: Feature Engineering Provides No Defense Against Neural Adversarial Transfer},
  author = {Achraf Hsain and Ahmed Abdelkader and Emmanuel Baldwin Mbaya and Hamoud Aljamaan},
  journal= {arXiv preprint arXiv:2601.21323},
  year   = {2026}
}