中文

层次化概念嵌入可解释模型

机器学习 2026-03-02 v1 人工智能

摘要

现代深度神经网络因其潜在表征的不透明性而难以解释,阻碍了模型的理解、调试和消除偏见。概念嵌入模型(Concept Embedding Models, CEMs)通过将输入映射到人类可解释概念表征来缓解这一问题,但CEMs未能表示概念之间的相互关系,且在训练过程中需要不同粒度的概念标注,限制了其适用性。在本文中,我们引入了层次化概念嵌入模型(Hierarchical Concept Embedding Models, HiCEMs),这是一类显式通过层次化结构建模概念关系的CEMs。为使HiCEMs在实际场景中可用,我们提出了概念分裂(Concept Splitting)方法,能够在无需额外标注的情况下,从预训练CEMs的嵌入空间中自动发现更细粒度的子概念。这使得HiCEMs能够从有限的概念标签生成细粒度解释,减少标注负担。我们在多个数据集上进行评估,包括用户研究以及我们新提出的基于概念的3D厨房渲染数据集PseudoKitchens的实验,结果表明:(1)概念分裂发现了训练时不存在且可被人类理解的子概念,可用于训练高度准确的HiCEMs;(2)HiCEMs支持在不同粒度上进行测试时概念干预,显著提升任务准确率。

关键词

引用

@article{arxiv.2602.23947,
  title  = {Hierarchical Concept-based Interpretable Models},
  author = {Oscar Hill and Mateo Espinosa Zarlenga and Mateja Jamnik},
  journal= {arXiv preprint arXiv:2602.23947},
  year   = {2026}
}

备注

Published as a conference paper at ICLR 2026