通过删除与再训练调试概念瓶颈模型
计算机视觉与模式识别
2026-03-27 v2 机器学习
摘要
概念瓶颈模型(CBM)使用一组人类可解释的概念来预测最终任务标签,使领域专家不仅能验证 CBM 的预测,还能在测试时干预错误的概念。然而,这些干预未能解决 CBM 与专家推理之间系统性的误对齐问题,例如模型从偏倚数据中学习捷径。为此,我们提出了一种通用的可解释调试框架,用于 CBM,遵循删除与再训练的两步流程。在删除步骤中,专家使用概念解释来识别并删除任何不必要的概念。在再训练步骤中,我们引入了 CBDebug,这是一种新颖的方法,利用 CBM 的可解释性作为桥梁,将概念级别的用户反馈转换为样本级别的辅助标签。这些标签随后用于应用监督性偏见缓解和针对性数据增强,以减少模型对不必要概念的依赖。我们使用真实和自动化的专家反馈评估了该框架,发现 CBDebug 在多个 CBM 架构(如 PIP-Net、Post-hoc CBM)和已知存在虚假关联的基准测试中均显著优于先前的再训练方法。
引用
@article{arxiv.2509.21385,
title = {Debugging Concept Bottleneck Models through Removal and Retraining},
author = {Eric Enouen and Sainyam Galhotra},
journal= {arXiv preprint arXiv:2509.21385},
year = {2026}
}
备注
Accepted to ICLR 2026