DRIFT:过滤变换中的发散响应,用于鲁棒对抗性防御
计算机视觉与模式识别
2025-09-30 v1 机器学习
摘要
深度神经网络高度易受对抗样本攻击,大多数防御一旦梯度可被可靠估计便会失效。我们识别出“梯度共识”——随机变换倾向于产生一致梯度——作为对抗可移性的关键驱动因素。攻击者利用这一共识构建有效跨变换的扰动。我们提出DRIFT(Divergent Response in Filtered Transformations),即由一组轻量、可学习滤波器构成的随机集团,这些滤波器被训练用于主动干扰梯度共识。与依赖梯度遮蔽的先前随机防御不同,DRIFT通过最大化雅可比空间和逻辑空间响应的差异,维持自然预测的同时实现“梯度不一致”。我们的贡献有三方面:(i)我们形式化梯度共识,提供将其与可移性关联的理论分析;(ii)我们提出一种共识-不一致训练策略,结合预测一致性、雅可比分离、逻辑空间分离和对抗鲁棒性;(iii)我们表明DRIFT在ImageNet上针对CNN和Vision Transformer实现显著鲁棒性提升,优于基于自适应白盒、迁移式和梯度-free攻击的先进预处理、对抗训练和扩散防御。DRIFT在几乎零运行时和内存开销下交付这些改进,确立梯度不一致作为实用且通用对抗防御原则。
引用
@article{arxiv.2509.24359,
title = {DRIFT: Divergent Response in Filtered Transformations for Robust Adversarial Defense},
author = {Amira Guesmi and Muhammad Shafique},
journal= {arXiv preprint arXiv:2509.24359},
year = {2025}
}