DIFFender:基于扩散模型的对抗补丁攻击防御方法
计算机视觉与模式识别
2024-07-18 v4 人工智能
密码学与安全
机器学习
摘要
对抗攻击,尤其是补丁攻击,对深度学习模型的鲁棒性与可靠性构成重大威胁。开发针对补丁攻击的可靠防御对现实应用至关重要。本文提出 DIFFender,一种利用文本引导扩散模型能力来抵御补丁攻击的新型防御框架。我们方法的核心在于发现了对抗异常感知(AAP)现象,它使扩散模型能够通过分析分布差异来检测并定位对抗补丁。DIFFender 在单一扩散模型框架内集成了补丁定位与修复双重任务,利用二者的紧密交互提升防御效能。此外,DIFFender 利用视觉-语言预训练以及高效的少样本提示微调算法,简化了预训练扩散模型对防御任务的适配,从而免除了大量重训练的需要。我们的综合评估涵盖图像分类与人脸识别任务,并延伸至真实场景,DIFFender 在其中展现出良好的对抗攻击鲁棒性。DIFFender 的通用性与可泛化性在各种设置、分类器及攻击方法中均得到体现,标志着对抗补丁防御策略的一项进展。
引用
@article{arxiv.2306.09124,
title = {DIFFender: Diffusion-Based Adversarial Defense against Patch Attacks},
author = {Caixin Kang and Yinpeng Dong and Zhengyi Wang and Shouwei Ruan and Yubo Chen and Hang Su and Xingxing Wei},
journal= {arXiv preprint arXiv:2306.09124},
year = {2024}
}