中文

用于纠正捷径学习的眼动注视引导视觉 Transformer

计算机视觉与模式识别 2022-05-26 v1

摘要

学习有害捷径(如伪相关与偏差)会阻碍深度神经网络学习有意义且有用的表示,从而危及所学表示的泛化性与可解释性。在医学影像中情况更为严重,因为临床数据(例如带病灶的 MR 图像)有限且稀缺,而对所学模型的可靠性、泛化性与透明性要求极高。为解决该问题,我们提出将人类专家的智能与领域知识注入深度神经网络的训练。核心思想是将放射科专家视觉注意信息注入,主动引导深度模型关注潜在病灶区域,避免陷入有害捷径学习。为此,我们提出一种新颖的眼动注视引导视觉 Transformer(EG-ViT),用于有限医学图像数据的诊断。我们对放射科医生不感兴趣的输入图像块进行掩码,并在 EG-ViT 最后编码器层中添加额外残差连接以保持所有图像块的相关性。在 INbreast 与 SIIM-ACR 两个公开数据集上的实验表明,我们的 EG-ViT 模型能有效学习/迁移专家领域知识,并取得远优于基线的性能。同时,它成功纠正了有害捷径学习,并显著提升了 EG-ViT 模型的可解释性。总体而言,EG-ViT 兼具人类专家先验知识与深度神经网络之优势。本工作通过注入人类智能,为推进当前人工智能范式开辟了新途径。

关键词

引用

@article{arxiv.2205.12466,
  title  = {Eye-gaze-guided Vision Transformer for Rectifying Shortcut Learning},
  author = {Chong Ma and Lin Zhao and Yuzhong Chen and Lu Zhang and Zhenxiang Xiao and Haixing Dai and David Liu and Zihao Wu and Zhengliang Liu and Sheng Wang and Jiaxing Gao and Changhe Li and Xi Jiang and Tuo Zhang and Qian Wang and Dinggang Shen and Dajiang Zhu and Tianming Liu},
  journal= {arXiv preprint arXiv:2205.12466},
  year   = {2022}
}