中文

基于人类层级概念的可解释失败检测

计算机视觉与模式识别 2025-04-16 v2

摘要

可靠的失败检测在安全关键应用中至关重要。然而,已知神经网络会对错误分类的样本产生过度自信的预测。因此,由于现有的置信度评分函数依赖于类别级别的信号(即 logits)来检测失败,这仍然是一个棘手的问题。本研究引入了一种创新策略,利用人类层级的概念实现双重目的:可靠地检测模型何时失败,并透明地解释其原因。通过为每个类别整合一组细微的信号,我们的方法能够对模型的置信度进行更细粒度的评估。我们提出了一种简单但高效的方法,该方法基于概念激活对输入图像的序数排序。在没有过多修饰的情况下,我们的方法显著降低了各种真实世界图像分类基准上的假阳性率,具体而言,在 ImageNet 上降低了 3.7%,在 EuroSAT 上降低了 9%。

关键词

引用

@article{arxiv.2502.05275,
  title  = {Interpretable Failure Detection with Human-Level Concepts},
  author = {Kien X. Nguyen and Tang Li and Xi Peng},
  journal= {arXiv preprint arXiv:2502.05275},
  year   = {2025}
}