通过可证明的对抗性噪声放大检测对抗数据
机器学习
2026-05-05 v1 密码学与安全
摘要
深度神经网络层之间对抗噪声的非均匀和逐渐增加的影响已被用于文献中,但缺乏形式的数学依据来检测对抗输入并提高鲁棒性。在本工作中,我们详细研究了这一现象并提出了形式的对抗噪声放大定理。我们指定了一组充分条件,确保对抗噪声放大在数学上是保证的。基于理论观察,我们提出了一种新的训练方法,采用自定义谱损失函数和特定的网络设计,以增强检测对抗数据所用的放大信号。最后,我们引入一种新的轻量级检测机制,利用增强的放大信号,在推理阶段完全运行。为验证我们的方法,我们展示了该检测器对抗最先进的攻击以及一个专为设计的自适应攻击都具有有效性,确认增强的放大可以作为对抗防御的稳健可靠信号。
引用
@article{arxiv.2605.02109,
title = {Detecting Adversarial Data via Provable Adversarial Noise Amplification},
author = {Furkan Mumcu and Yasin Yilmaz},
journal= {arXiv preprint arXiv:2605.02109},
year = {2026}
}