中文

基于极值理论的 SPADE 方法:为分类器提供对 OOD 和对抗样本的可证明保护

机器学习 2025-01-20 v1 机器学习

摘要

本文引入一种新方法,称为基于极值理论的样本高效概率检测(SPADE),该方法将分类器转换为具有可证明保护能力的拒绝分类器,以应对分布外样本和对抗样本。该方法基于分类器潜空间中训练分布的广义极值(GEV)模型,使我们能够形式化地表征分布外样本。有趣的是,在轻微假设下,GEV 模型还允许对形式化地表征对抗样本。基于 GEV 模型对样本进行评估后进行拒绝的拒绝分类器,可在形式上避免分布外和对抗样本。该方法的实证验证在各种神经网络架构(ResNet、VGG 和 Vision Transformer)以及中大型数据集(CIFAR-10、CIFAR-100 和 ImageNet)上进行,结果显示其在效率、稳定性和性能方面均优于当前最先进的方法。

关键词

引用

@article{arxiv.2501.10202,
  title  = {Provably Safeguarding a Classifier from OOD and Adversarial Samples: an Extreme Value Theory Approach},
  author = {Nicolas Atienza and Christophe Labreuche and Johanne Cohen and Michele Sebag},
  journal= {arXiv preprint arXiv:2501.10202},
  year   = {2025}
}

备注

under review