中文

反思图像分类中失败检测的评估实践:一项呼吁

计算机视觉与模式识别 2023-04-06 v2 机器学习

摘要

在现实世界中可靠地应用基于机器学习的决策系统是该领域当前研究的主要挑战之一。大部分现有方法旨在通过分配置信度分数来检测错误预测。这种置信度可以通过量化模型的预测不确定性、学习显式的评分函数或评估输入是否与训练分布一致来获得。奇怪的是,虽然这些方法都声称旨在解决在现实应用中检测分类器失败的相同最终目标,但它们目前构成了很大程度上分离的研究领域,各自拥有独立的评估协议,这些协议要么排除了相关方法的很大一部分,要么忽略了相关失败来源的很大一部分。在这项工作中,我们系统地揭示了当前由这些不一致性导致的陷阱,并推导出对失败检测进行整体和现实评估的要求。为了证明这种统一视角的相关性,我们首次展示了一项大规模实证研究,使得能够针对所有相关方法和失败来源对置信度评分函数进行基准测试。一个简单的softmax响应基线被揭示为整体表现最佳的方法,这一发现突显了在大量已发表的置信度评分研究中当前评估存在的严重缺陷。代码和训练模型可在https://github.com/IML-DKFZ/fd-shifts获取。

关键词

引用

@article{arxiv.2211.15259,
  title  = {A Call to Reflect on Evaluation Practices for Failure Detection in Image Classification},
  author = {Paul F. Jaeger and Carsten T. Lüth and Lukas Klein and Till J. Bungert},
  journal= {arXiv preprint arXiv:2211.15259},
  year   = {2023}
}