ZeroPur:无需训练的简洁对抗性净化
计算机视觉与模式识别
2025-05-28 v3 密码学与安全
摘要
对抗性净化是一种可防御各种未知对抗攻击而无需修改受害者分类器的防御技术。现有方法常依赖外部生成模型或辅助函数与受害者分类器之间的合作。然而,重新训练生成模型、辅助函数或受害者分类器都依赖于微调数据集的领域且计算耗费。在本工作中,我们假设对抗性图像是自然图像流形的异常值,而净化过程可被视为将其返回到该流形。基于此假设,我们提出了一种无需进一步训练的简单对抗净化方法,称为ZeroPur。ZeroPur包含两个步骤:给定对抗性示例,Guided Shift通过其模糊版本的指导获得该对抗性示例的偏移嵌入;随后,Adaptive Projection通过该偏移嵌入构建方向向量以提供动量,自适应地将对抗性图像投影到流形上。ZeroPur独立于外部模型,无需重新训练受害者分类器或辅助函数,仅依赖受害者分类器本身即可实现净化。在使用ResNet和WideResNet等各种分类器架构进行大规模实验中,ZeroPur在CIFAR-10、CIFAR-100和ImageNet-1K三个数据集上实现了最先进的鲁棒性能。代码将公开 disponible。
引用
@article{arxiv.2406.03143,
title = {ZeroPur: Succinct Training-Free Adversarial Purification},
author = {Erhu Liu and Zonglin Yang and Bo Liu and Bin Xiao and Xiuli Bi},
journal= {arXiv preprint arXiv:2406.03143},
year = {2025}
}
备注
17 pages, 7 figures, under review