强近分布外检测方法的对抗脆弱性
机器学习
2022-01-19 v1
摘要
近来,神经网络中检测分布外(OOD)输入取得了显著进展,主要得益于在大型数据集上预训练的大型模型的使用,以及多模态的兴起应用。我们展示了即便是最强的当前 OOD 检测技术也存在严重的对抗脆弱性。通过对输入像素施加微小的针对性扰动,我们可以轻易地将图像从分布内判定改为分布外,反之亦然。具体而言,我们在具有挑战性的近 OOD CIFAR-100 对 CIFAR-10 任务以及远 OOD CIFAR-100 对 SVHN 上展示了严重的对抗脆弱性。我们研究了若干后处理技术的对抗鲁棒性,包括最大 softmax 概率(MSP)的简单基线、马哈拉诺比斯距离,以及新提出的\textit{相对}马哈拉诺比斯距离。通过比较不同扰动强度下 OOD 检测性能的下降,我们展示了使用 OOD 检测器集成以及使用\textit{相对}马哈拉诺比斯距离相对于其他后处理方法的益处。此外,我们表明即便使用 CLIP 与多模态的强零样本 OOD 检测也同样严重缺乏对抗鲁棒性。我们的代码见 https://github.com/stanislavfort/adversaries_to_OOD_detection
引用
@article{arxiv.2201.07012,
title = {Adversarial vulnerability of powerful near out-of-distribution detection},
author = {Stanislav Fort},
journal= {arXiv preprint arXiv:2201.07012},
year = {2022}
}
备注
8 pages