中文

基于对抗一致性蒸馏的即时对抗净化

计算机视觉与模式识别 2025-03-24 v3 人工智能 机器学习

摘要

神经网络以其卓越的性能颠覆了众多领域,但它们仍然容易受到通过细微扰动进行的对抗攻击。虽然像 DiffPure 这样基于扩散的净化方法提供了有前景的防御机制,但其计算开销带来了显著的实际限制。在本文中,我们引入了单步控制净化 (One Step Control Purification, OSCP),这是一种新颖的防御框架,可在扩散模型中通过单次神经函数评估 (Neural Function Evaluation, NFE) 实现鲁棒的对抗净化。我们提出高斯对抗噪声蒸馏 (Gaussian Adversarial Noise Distillation, GAND) 作为蒸馏目标,并提出了控制对抗净化 (Controlled Adversarial Purification, CAP) 作为推理流水线,这使得 OSCP 在保持防御有效性的同时展现出卓越的效率。我们提出的 GAND 解决了一致性蒸馏与对抗扰动之间的根本矛盾,弥合了潜在空间中自然流形与对抗流形之间的差距,同时通过诸如 LoRA 等参数高效微调 (Parameter-Efficient Fine-Tuning, PEFT) 方法保持了计算高效性,消除了全参数微调对高计算预算的需求。CAP 通过由输入图像计算出的不可学习的边缘检测算子作为额外提示来引导净化过程,有效防止了在使用大净化步长时净化后的图像偏离其原始外观。我们在 ImageNet 上的实验结果展示了 OSCP 的卓越性能,每次净化仅需 0.1s 即可达到 74.19\% 的防御成功率——相比传统方法实现了 100 倍的加速。

关键词

引用

@article{arxiv.2408.17064,
  title  = {Instant Adversarial Purification with Adversarial Consistency Distillation},
  author = {Chun Tong Lei and Hon Ming Yam and Zhongliang Guo and Yifei Qian and Chun Pong Lau},
  journal= {arXiv preprint arXiv:2408.17064},
  year   = {2025}
}

备注

Accepted by CVPR2025