基于潜在集成的随机共振之对抗攻击测试时防御
计算机视觉与模式识别
2025-10-06 v1 人工智能
机器学习
摘要
我们提出了一种针对对抗攻击的测试时防御机制:对抗攻击是指那些能显著改变模型预测的不可感知图像扰动。现有方法依赖于特征过滤或平滑,这可能导致信息丢失,与此不同,我们提出利用随机共振“以噪声对抗噪声”,在最小化信息丢失的同时增强鲁棒性。我们的方法对输入图像引入微小的平移扰动,对齐变换后的特征嵌入,并在映射回原始参考图像之前对其进行聚合。这可以用闭式公式表达,能够部署在多种现有网络架构上,而无需引入额外的网络模块或针对特定攻击类型进行微调。由此产生的方法完全无需训练、与架构无关且与攻击无关。实证结果表明,该方法在图像分类上达到了 SOTA 的鲁棒性,并首次为密集预测任务(包括立体匹配和光流)建立了通用的测试时防御,突显了该方法的通用性和实用性。具体而言,相对于干净(未受扰动)的性能,在各种类型的对抗攻击下,我们的方法在图像分类上恢复了高达 68.1% 的准确率损失,在立体匹配上恢复了 71.9%,在光流上恢复了 29.2%。
引用
@article{arxiv.2510.03224,
title = {Test-Time Defense Against Adversarial Attacks via Stochastic Resonance of Latent Ensembles},
author = {Dong Lao and Yuxiang Zhang and Haniyeh Ehsani Oskouie and Yangchao Wu and Alex Wong and Stefano Soatto},
journal= {arXiv preprint arXiv:2510.03224},
year = {2025}
}