针对未预见对抗样本的鲁棒性测试
机器学习
2023-10-31 v4 密码学与安全
计算机视觉与模式识别
机器学习
摘要
对抗鲁棒性研究主要关注 L_p 扰动,且大多数防御方法是在训练时和测试时使用相同的对抗样本开发的。然而,在现实应用中,开发者不太可能接触到其系统将面临的所有攻击或损坏类型。此外,最坏情况的输入可能是多样化的,不必局限于 L_p 球。为缩小研究与现实之间的这一差距,我们引入了 ImageNet-UA,这是一个用于评估模型针对一系列未预见对抗样本(包括十八种新的非 L_p 攻击)鲁棒性的框架。要在 ImageNet-UA 上表现良好,防御方法必须克服泛化差距,并对训练期间未遇到的各种攻击具有鲁棒性。在大量实验中,我们发现现有的鲁棒性度量无法捕捉未预见鲁棒性,标准鲁棒性技术被替代训练策略击败,而新颖的方法可以提升未预见鲁棒性。我们将 ImageNet-UA 作为一个有用的工具呈现给社区,用于改善机器学习系统的最坏情况行为。
引用
@article{arxiv.1908.08016,
title = {Testing Robustness Against Unforeseen Adversaries},
author = {Max Kaufmann and Daniel Kang and Yi Sun and Steven Basart and Xuwang Yin and Mantas Mazeika and Akul Arora and Adam Dziedzic and Franziska Boenisch and Tom Brown and Jacob Steinhardt and Dan Hendrycks},
journal= {arXiv preprint arXiv:1908.08016},
year = {2023}
}
备注
Datasets available at https://github.com/centerforaisafety/adversarial-corruptions