中文

图集成多模态概念瓶颈模型

计算机视觉与模式识别 2025-10-02 v1

摘要

随着深度学习中可解释性需求的增长,特别是在高风险领域,概念瓶颈模型(CBMs)通过在预测流程中插入人类可理解的概念来解决这一问题,但它们通常是单模态的,且忽略了结构化的概念关系。为克服这些局限性,我们提出了MoE-SGT,这是一个推理驱动的框架,通过注入图变换器的结构模块和专家混合(MoE)模块来增强CBMs。我们为多模态输入构建了答案-概念图和答案-问题图,以显式建模概念之间的结构化关系。随后,我们集成了图变换器以捕捉多层级依赖关系,解决了传统概念瓶颈模型在建模概念交互方面的局限性。然而,它在适应复杂概念模式时仍然遇到瓶颈。因此,我们用专家混合(MoE)模块替换前馈层,使模型在学习多样化概念关系方面具有更大能力,同时将推理任务动态分配给不同的子专家,从而显著增强了模型对复杂概念推理的适应性。MoE-SGT通过建模概念之间的结构化关系和利用动态专家选择机制,在多个数据集上取得了比其他概念瓶颈网络更高的准确率。

关键词

引用

@article{arxiv.2510.00701,
  title  = {Graph Integrated Multimodal Concept Bottleneck Model},
  author = {Jiakai Lin and Jinchang Zhang and Guoyu Lu},
  journal= {arXiv preprint arXiv:2510.00701},
  year   = {2025}
}