全能无处不在:针对对抗鲁棒性的多尺度聚合
计算机视觉与模式识别
2024-08-13 v1 机器学习
摘要
对抗样本对深度神经网络的鲁棒性、可靠性和对齐性构成了重大挑战。我们提出了一种新颖且易于使用的方法,通过多分辨率输入表示和中间层预测的动态自集成,来实现高质量的表征并实现对抗鲁棒性。我们展示,中间层预测对针对完整分类器造成欺骗的对抗攻击天然具有鲁棒性,并提出基于Vickrey拍卖的稳健聚合机制,称为\textit{CrossMax},用于动态集成这些预测。通过结合多分辨率输入和稳健集成,我们在CIFAR-10和CIFAR-100数据集上实现了显著的对抗鲁棒性,无需任何对抗训练或额外数据,即可在RobustBench AutoAttack套件()上实现约72%的对抗准确率(CIFAR-10)和约48%的对抗准确率(CIFAR-100),使用在ImageNet上微调的ResNet152。这一结果相当于CIFAR-10排名前三的模型,相较于CIFAR-100当前最佳专用方法提升了约5%。在上述方法之上添加简单的对抗训练,我们可实现约78%的CIFAR-10准确率和约51%的CIFAR-100准确率,分别将SOTA提升了5%和9%,在更难的数据集上获得更大的提升。我们通过大量实验验证了该方法,并提供了对抗鲁棒性与深度表征层次性之间相互作用的见解。我们展示,针对我们模型的简单梯度攻击会导致针对目标类别的人类可解释图像以及可解释图像变化。作为副产品,使用我们的多分辨率先验,我们将预训练分类器和CLIP模型转化为可控图像生成器,并在大型视觉语言模型上开发出成功的可迁移攻击。
引用
@article{arxiv.2408.05446,
title = {Ensemble everything everywhere: Multi-scale aggregation for adversarial robustness},
author = {Stanislav Fort and Balaji Lakshminarayanan},
journal= {arXiv preprint arXiv:2408.05446},
year = {2024}
}
备注
34 pages, 25 figures, appendix