中文

SurroCBM:用于生成式事后解释的概念瓶颈代理模型

人工智能 2023-10-12 v1 机器学习

摘要

可解释 AI 旨在揭示黑盒模型的决策过程。传统的基于显著性的方法虽然能突出有影响力的数据片段,但往往缺乏语义理解。近期进展如概念激活向量(CAVs)和概念瓶颈模型(CBMs)提供了基于概念的解释,但需要有人类定义的概念。然而,人类标注概念获取成本高昂。本文提出概念瓶颈代理模型(SurroCBM),一种旨在通过自动发现的概念来解释黑盒模型的新框架。SurroCBM 识别不同黑盒模型间共享与独特的概念,并采用可解释的代理模型进行事后解释。提出了一种利用自生成数据的有效训练策略以持续提升解释质量。通过大量实验,我们展示了 SurroCBM 在概念发现与解释上的有效性,凸显其在推进可解释 AI 领域的潜力。

关键词

引用

@article{arxiv.2310.07698,
  title  = {SurroCBM: Concept Bottleneck Surrogate Models for Generative Post-hoc Explanation},
  author = {Bo Pan and Zhenke Liu and Yifei Zhang and Liang Zhao},
  journal= {arXiv preprint arXiv:2310.07698},
  year   = {2023}
}