中文

R-Cut:利用关系加权 Out 与 Cut 增强视觉 Transformer 的可解释性

计算机视觉与模式识别 2023-07-19 v1 人工智能

摘要

基于 Transformer 的模型在自然语言处理(NLP)领域已广受欢迎,并广泛用于计算机视觉任务以及 GPT4 等多模态模型。本文提出一种增强基于 Transformer 的图像分类模型可解释性的新方法。我们的方法旨在通过提供类特异性图的可视化,提升对分类结果的信任,并赋予用户更深入理解模型以用于下游任务的能力。我们引入两个模块:“Relationship Weighted Out”与“Cut”模块。“Relationship Weighted Out”模块专注于从中间层提取类特异性信息,使我们能够突出相关特征。此外,“Cut”模块执行细粒度特征分解,考虑位置、纹理与颜色等因素。通过集成这些模块,我们生成稠密的类特异性视觉可解释性图。我们在 ImageNet 数据集上通过大量定性与定量实验验证我们的方法。此外,我们在专为自动驾驶危险预警设计的 LRN 数据集上进行大量实验,以评估我们的方法在复杂背景下的可解释性。结果表明相较以往方法有显著改进。而且,我们进行消融实验以验证各模块的有效性。通过这些实验,我们能够确认各模块的相应贡献,从而巩固所提方法的整体有效性。

关键词

引用

@article{arxiv.2307.09050,
  title  = {R-Cut: Enhancing Explainability in Vision Transformers with Relationship Weighted Out and Cut},
  author = {Yingjie Niu and Ming Ding and Maoning Ge and Robin Karlsson and Yuxiao Zhang and Kazuya Takeda},
  journal= {arXiv preprint arXiv:2307.09050},
  year   = {2023}
}