通过联合对抗训练提升预处理防御的白盒鲁棒性
计算机视觉与模式识别
2024-03-26 v2
摘要
深度神经网络(DNNs)易受对抗噪声干扰。已有多种对抗防御技术被提出以缓解对抗噪声的干扰,其中输入预处理方法具有可扩展性,并展现出保护 DNNs 的巨大潜力。然而,预处理方法可能遭受鲁棒性退化效应,即在白盒设定下该防御反而降低而非提升目标模型的对抗鲁棒性。此负面效应的一个潜在原因是对抗训练样本是静态的且独立于预处理模型。为解决该问题,我们探究了针对完整模型生成的完整对抗样本的影响,发现它们确实对防御鲁棒性有正向作用。此外,我们发现仅改变预处理方法中的对抗训练样本并不能完全缓解鲁棒性退化效应。这是因为预处理后模型的对抗风险被忽视,这也是鲁棒性退化效应的另一成因。受上述分析启发,我们提出一种称为基于联合对抗训练的预处理(JATP)防御方法。具体而言,我们利用在特征空间中找到的完整对抗样本,为预处理模型构建了基于特征相似度的对抗风险。与标准对抗训练不同,我们仅更新预处理模型,这促使我们引入逐像素损失以提升其跨模型迁移性。随后我们对预处理模型进行联合对抗训练以最小化该总体风险。实证结果表明,与先前最先进方法相比,我们的方法能有效缓解不同目标模型上的鲁棒性退化效应。
引用
@article{arxiv.2106.05453,
title = {Improving White-box Robustness of Pre-processing Defenses via Joint Adversarial Training},
author = {Dawei Zhou and Nannan Wang and Xinbo Gao and Bo Han and Jun Yu and Xiaoyu Wang and Tongliang Liu},
journal= {arXiv preprint arXiv:2106.05453},
year = {2024}
}