中文

概念基模型中的信息泄漏与可解释性

机器学习 2026-03-25 v3 人工智能 机器学习

摘要

概念基模型旨在通过预测高层中间概念来提高可解释性,这是一种针对高风险场景部署的有前景的 метод。然而,这些模型已知存在信息泄漏问题,即模型会利用在所学概念中编码的意外信息。我们引入信息论框架,以严格描述和量化泄漏现象,定义两种互补措施:概念-任务泄漏(CTL)和概念间泄漏(ICL)得分。我们表明,这些措施在干预下的模型行为方面具有强大的预测性,并优于现有方法。通过该框架,我们识别了泄漏的主要原因;作为案例研究,我们分析了概念嵌入模型中泄漏的实现方式,揭示了除设计中固有的概念-任务泄漏外,还存在概念间泄漏和对齐泄漏。最后,我们提出了一套实用指南,用于设计概念基模型以减少泄漏并确保可解释性。

关键词

引用

@article{arxiv.2504.14094,
  title  = {Leakage and Interpretability in Concept-Based Models},
  author = {Enrico Parisini and Tapabrata Chakraborti and Chris Harbron and Ben D. MacArthur and Christopher R. S. Banerji},
  journal= {arXiv preprint arXiv:2504.14094},
  year   = {2026}
}

备注

39 pages, 25 figures