通过视觉显著性纠正 ViT 的捷径学习
计算机视觉与模式识别
2022-06-20 v1
摘要
捷径学习在深度学习模型中常见但有害,会导致退化的特征表示,进而损害模型的泛化能力与可解释性。然而,在广泛使用的视觉 Transformer(ViT)框架中的捷径学习在很大程度上尚属未知。同时,引入领域特定知识是纠正主要由背景相关因素主导的捷径的主要途径。例如,在医学影像领域,放射科医生的眼动注视数据是一种有效的人类视觉先验知识,极有潜力引导深度学习模型关注有意义的前景感兴趣区域。然而,获取眼动注视数据耗时、费力,有时甚至不具可行性。本工作中,我们提出一种新颖且有效的显著性引导视觉 Transformer(SGT)模型,在缺乏眼动注视数据的情况下纠正 ViT 中的捷径学习。具体而言,采用计算视觉显著性模型为输入图像样本预测显著性图。随后,利用显著性图蒸馏出信息量最大的图像块。在所提 SGT 中,图像块间的自注意力仅聚焦于被蒸馏出的信息块。考虑到该蒸馏操作可能导致全局信息丢失,我们进一步在最后一层编码器引入捕获所有图像块间自注意力的残差连接。在四个独立公开数据集上的实验结果表明,我们的 SGT 框架无需眼动数据即可有效学习并利用人类先验知识,并取得远优于基线的性能。同时,它成功纠正了有害的捷径学习,显著提升了 ViT 模型的可解释性,展示了利用源自人类先验知识的视觉显著性纠正捷径学习的潜力。
引用
@article{arxiv.2206.08567,
title = {Rectify ViT Shortcut Learning by Visual Saliency},
author = {Chong Ma and Lin Zhao and Yuzhong Chen and David Weizhong Liu and Xi Jiang and Tuo Zhang and Xintao Hu and Dinggang Shen and Dajiang Zhu and Tianming Liu},
journal= {arXiv preprint arXiv:2206.08567},
year = {2022}
}
备注
NeurIPS2022 Under Review