中文

分布外数据可证明对抗鲁棒检测

机器学习 2021-03-11 v3 计算机视觉与模式识别 机器学习

摘要

已知深度神经网络在应用于明显不属于任何类别的分布外(OOD)输入时会过度自信。这在安全关键应用中是个问题,因为对分类器不确定性的可靠评估是一项关键属性,可使系统触发人工干预或转入安全状态。本文中,我们通过对 OOD 点及其周围 ll_\infty 球内不仅强制低置信度,而且强制低置信度,从而致力于为 OOD 检测提供可证明的最坏情况保证。为此,我们使用区间界限传播(IBP)来给出 ll_\infty 球内最大置信度的上界,并在训练时最小化该上界。我们表明,对训练时未见 OOD 数据集的 OOD 数据置信度获得可泛化的非平凡界是可能的。此外,与通常伴随显著预测性能损失的认证对抗鲁棒性不同,最坏情况 OOD 检测的可证明保证可在不损失太多准确率的情况下实现。

关键词

引用

@article{arxiv.2007.08473,
  title  = {Certifiably Adversarially Robust Detection of Out-of-Distribution Data},
  author = {Julian Bitterwolf and Alexander Meinke and Matthias Hein},
  journal= {arXiv preprint arXiv:2007.08473},
  year   = {2021}
}

备注

Published and presented at NeurIPS 2020. Code available at https://gitlab.com/Bitterwolf/GOOD v3: added missing acknowledgement