MCCE:缺失感知因果概念解释器
机器学习
2024-11-15 v1
摘要
因果概念效应估计在可解释机器学习领域受到越来越多的关注。这一方法通过估计人类可理解概念的因果效应来解释机器学习模型的行为,这些概念比词元等原始输入更能直观地表示高层知识。然而,现有的因果概念效应解释方法假设数据集中涉及的所有概念都被完整观测到,由于标注不完整或概念数据缺失,这在实践中可能失效。我们在理论上证明了未观测概念会导致对已观测概念因果效应估计的偏差。为解决这一局限,我们提出了缺失感知因果概念解释器(MCCE),这是一个专门设计用于在并非所有概念均可观测时估计因果概念效应的新框架。该框架学习以补偿缺失概念导致的残余偏差,并利用线性预测器建模这些概念与黑盒机器学习模型输出之间的关系。它能够提供局部和全局两个层面的解释。我们使用真实世界数据集进行验证,结果表明 MCCE 在因果概念效应估计方面相比最先进的解释方法取得了有竞争力的性能。
引用
@article{arxiv.2411.09639,
title = {MCCE: Missingness-aware Causal Concept Explainer},
author = {Jifan Gao and Guanhua Chen},
journal= {arXiv preprint arXiv:2411.09639},
year = {2024}
}