中文

eX-ViT:一种用于弱监督语义分割的可解释视觉Transformer

计算机视觉与模式识别 2022-07-13 v1

摘要

近年来,视觉Transformer模型已成为一系列视觉任务中的重要模型。然而,这些模型通常是不透明的,特征可解释性较弱。此外,目前尚无针对内在可解释Transformer的构建方法,这类Transformer能够解释其推理过程并提供忠实的解释。为弥补这些关键空白,我们提出了一种新颖的视觉Transformer,称为可解释视觉Transformer(eX-ViT),它是一种内在可解释的Transformer模型,能够联合发现鲁棒的可解释特征并进行预测。具体而言,eX-ViT由可解释多头注意力(E-MHA)模块、属性引导解释器(AttE)模块以及自监督属性引导损失组成。E-MHA定制了可解释的注意力权重,能够从局部图像块中学习语义可解释表示,且对噪声具有鲁棒性,并关联模型决策。同时,提出AttE通过多样化属性发现为目标对象编码判别性属性特征,这些特征构成模型预测的忠实证据。此外,我们为eX-ViT开发了自监督属性引导损失,旨在通过属性判别机制和属性多样性机制学习增强表示,以定位多样化且判别性的属性并生成更鲁棒的解释。因此,我们可通过所提eX-ViT揭示具有多样化属性的忠实且鲁棒的解释。

关键词

引用

@article{arxiv.2207.05358,
  title  = {eX-ViT: A Novel eXplainable Vision Transformer for Weakly Supervised Semantic Segmentation},
  author = {Lu Yu and Wei Xiang and Juan Fang and Yi-Ping Phoebe Chen and Lianhua Chi},
  journal= {arXiv preprint arXiv:2207.05358},
  year   = {2022}
}