基于极值理论的 SPADE 方法:为分类器提供对 OOD 和对抗样本的可证明保护
机器学习
2025-01-20 v1 机器学习
摘要
本文引入一种新方法,称为基于极值理论的样本高效概率检测(SPADE),该方法将分类器转换为具有可证明保护能力的拒绝分类器,以应对分布外样本和对抗样本。该方法基于分类器潜空间中训练分布的广义极值(GEV)模型,使我们能够形式化地表征分布外样本。有趣的是,在轻微假设下,GEV 模型还允许对形式化地表征对抗样本。基于 GEV 模型对样本进行评估后进行拒绝的拒绝分类器,可在形式上避免分布外和对抗样本。该方法的实证验证在各种神经网络架构(ResNet、VGG 和 Vision Transformer)以及中大型数据集(CIFAR-10、CIFAR-100 和 ImageNet)上进行,结果显示其在效率、稳定性和性能方面均优于当前最先进的方法。
引用
@article{arxiv.2501.10202,
title = {Provably Safeguarding a Classifier from OOD and Adversarial Samples: an Extreme Value Theory Approach},
author = {Nicolas Atienza and Christophe Labreuche and Johanne Cohen and Michele Sebag},
journal= {arXiv preprint arXiv:2501.10202},
year = {2025}
}
备注
under review