面向概念基方法的泄漏度量:信息论方法
机器学习
2025-07-22 v2 人工智能
摘要
概念瓶颈模型(CBM)旨在通过围绕人类可理解的概念来结构化预测,从而增强可解释性。然而,意外的信息泄漏——即预测信号绕过概念瓶颈——会损害其透明度。本文引入一种信息论度量来量化 CBM 中的信息泄漏,捕捉概念嵌入编码的额外、非预期信息的程度。我们通过受控的人工实验验证了该度量,证明其在检测各种配置下的泄漏趋势方面有效。我们的发现表明,特征和概念维度对泄漏具有显著影响,分类器选择对度量稳定性影响较大,其中 XGBoost 表现为最可靠的估计器。此外,初步调查表明,该度量在应用于软联合 CBM 时表现出预期行为,表明其在完全人工设置之外的实际情境中也能可靠地量化信息泄漏。虽然本研究在受控人工实验中严格评估了该度量,但未来的工作可将其扩展到真实世界数据集上。
引用
@article{arxiv.2504.09459,
title = {Measuring Leakage in Concept-Based Methods: An Information Theoretic Approach},
author = {Mikael Makonnen and Moritz Vandenhirtz and Sonia Laguna and Julia E Vogt},
journal= {arXiv preprint arXiv:2504.09459},
year = {2025}
}
备注
Published at ICLR 2025 Workshop on XAI4Science