可解释性引导的测试时对抗性防御
计算机视觉与模式识别
2024-09-24 v1 密码学与安全
机器学习
摘要
我们提出了一种新颖且低成本的测试时对抗性防御方法,通过设计可解释性引导的神经元重要性排序方法,以识别对输出类别重要的神经元。该方法是一种无需训练的方案,能够在最小计算开销下显著改善鲁棒性-精度权衡。虽然在效率上仅次于最有效的测试时防御方法(快4倍),但本方法对广泛的黑盒、白盒及自适应攻击都具有鲁棒性,而这些攻击会破坏以往的测试时防御方法。在标准RobustBench基准测试中,我们在CIFAR10、CIFAR100和ImageNet-1k上分别获得了平均提升2.6%、4.9%和2.8%。我们还展示,即使在强自适应攻击下,本方法相对于最新的测试时防御方法也能实现平均1.5%的改进。
引用
@article{arxiv.2409.15190,
title = {Interpretability-Guided Test-Time Adversarial Defense},
author = {Akshay Kulkarni and Tsui-Wei Weng},
journal= {arXiv preprint arXiv:2409.15190},
year = {2024}
}
备注
ECCV 2024. Project Page: https://lilywenglab.github.io/Interpretability-Guided-Defense/