中文

掩码注意力作为提升视觉Transformer可解释性的机制

计算机视觉与模式识别 2024-04-30 v1 图像与视频处理

摘要

视觉Transformer是当前组织病理学基础模型研究热潮的核心。它们通过将图像按规则网格分割成小块来处理,而不考虑其内容。然而,并非图像的所有部分对其理解都同等重要。这在计算病理学中尤其如此,其中背景完全无信息,并可能引入导致预测偏差的伪影。为了解决这个问题,我们提出了一种新方法,在视觉Transformer的注意力机制中显式地掩码背景。这确保了对应于背景块的令牌不会对最终的图像表示做出贡献,从而提高了模型的鲁棒性和可解释性。我们以前列腺癌的全切片图像分级作为案例研究来验证我们的方法。我们的结果表明,该方法在提供更准确且具有临床意义的注意力热图的同时,达到了与普通自注意力相当的性能。

关键词

引用

@article{arxiv.2404.18152,
  title  = {Masked Attention as a Mechanism for Improving Interpretability of Vision Transformers},
  author = {Clément Grisi and Geert Litjens and Jeroen van der Laak},
  journal= {arXiv preprint arXiv:2404.18152},
  year   = {2024}
}

备注

Accepted at MIDL 2024