中文

分类器引导增强基于扩散的对抗性纯化:保留预测信息

计算机视觉与模式识别 2024-08-13 v1

摘要

对抗性纯化是防御神经网络免受对抗攻击的有前景的方法之一。最近的研究表明,基于扩散概率模型的方法在图像分类任务中取得了巨大成功。然而,这些方法面临噪声去除与信息保留之间的困境。本文指出,基于扩散模型的对抗性纯化方法在核心去噪过程中逐渐丢失样本信息,导致后续分类任务中偶发标签偏移。作为补救措施,我们建议通过引入分类器置信度引导来抑制此类信息损失。具体地,我们提出Classifier-cOnfidence gUided Purification(COUP)算法,在保持远离分类器决策边界的同时对对抗性样本进行纯化。实验结果表明,COUP能在强力攻击方法下实现更好的对抗鲁棒性。

关键词

引用

@article{arxiv.2408.05900,
  title  = {Classifier Guidance Enhances Diffusion-based Adversarial Purification by Preserving Predictive Information},
  author = {Mingkun Zhang and Jianing Li and Wei Chen and Jiafeng Guo and Xueqi Cheng},
  journal= {arXiv preprint arXiv:2408.05900},
  year   = {2024}
}

备注

Accepted by ECAI 2024