GradID:基于梯度内在维度的对抗检测
机器学习
2025-12-16 v1 密码学与安全
计算机视觉与模式识别
摘要
尽管其卓越的性能表现,深度神经网络仍 exhibits 一个关键漏洞:小且常常不可见的对抗扰动会导致模型预测发生巨大改变。鉴于医疗诊断和自动驾驶等应用场景对可靠性的严格要求,对此类对抗攻击的稳健检测至关重要。本文我们研究模型输入损失景观的几何属性。我们分析模型梯度参数的内在维数(ID),该参数量化了描述其底层流形上数据点所需的最小坐标数。我们揭示了自然数据和对抗数据之间ID存在一种 distinct且一致的差异,这构成了我们提出检测方法的基础。我们在两种不同的操作场景下验证了该方法。首先,在批处理层面上识别恶意数据组方面,我们的方法在MNIST和SVHN等数据集上表现出高效。其次,在关键的单个样本设置下,我们在CIFAR-10和MS COCO等具有挑战性的基准数据集上取得了新的最先进结果。该检测器在包括CW和AutoAttack在内的广泛攻击类型下均显著优于现有方法,在CIFAR-10上检测率始终保持在92%以上。结果强调了该几何方法的鲁棒性,突显了内在维数作为一种跨越多样数据集和攻击策略的对抗检测指纹具有强大的判别力。
引用
@article{arxiv.2512.12827,
title = {GradID: Adversarial Detection via Intrinsic Dimensionality of Gradients},
author = {Mohammad Mahdi Razmjoo and Mohammad Mahdi Sharifian and Saeed Bagheri Shouraki},
journal= {arXiv preprint arXiv:2512.12827},
year = {2025}
}
备注
16 pages, 8 figures