基于概念的可解释错误切片发现方法 CB-SLICE
机器学习
2026-05-29 v1 人工智能
机器学习
摘要
尽管深度学习模型在平均情况下的性能优异,但往往在特定人口组别上表现出系统性错误,这些被称为错误切片。识别这些群体及其失败根源对于模型调试和偏差缓解至关重要。然而,现有的错误切片发现方法(SDMs)通常生成与模型推理过程不相连的解释,从而仅近似底层错误源,可能不准确。我们通过利用概念瓶颈模型(CBM),其预测直接依赖于人类可理解的语义概念。由于 CBM 的下游任务失败常常源于概念预测错误,概念表示成为强有力的错误切片识别候选,提供直接关联错误来源的细粒度解释。基于这一洞察,我们引入 CB-SLICE,一种基于概念的 SDM,将共享概念预测失败的样本分组,并识别每个切片最负责任的关键概念。我们在多个基准数据集上展示,CB-SLICE 在发现众所周知的偏差方面超越了最先进的方法,同时提供更丰富且更可信的模型错误解释。
引用
@article{arxiv.2605.29836,
title = {CB-SLICE: Concept-Based Interpretable Error Slice Discovery},
author = {Yael Konforti and Mateo Espinosa Zarlenga and Elaf Almahmoud and Mateja Jamnik},
journal= {arXiv preprint arXiv:2605.29836},
year = {2026}
}
备注
20 pages, 7 figures, 12 tables, to be published at Proceedings of the 43rd International Conference on Machine Learning (ICML 2026)