自监督视觉变换器中的先验知识引导注意力
计算机视觉与模式识别
2022-09-09 v1
摘要
自监督表示学习近期趋势集中于从训练流程中移除归纳偏置。然而,在可用数据有限或能提供对底层数据分布的额外洞察时,归纳偏置可能是有用的。我们提出空间先验注意力(SPAN),一种利用无标签图像数据集中一致的空间与语义结构来引导视觉变换器注意力的框架。SPAN 通过正则化来自独立变换器头的注意力掩码以遵循关于语义区域的各种先验而运作。这些先验可源自数据统计或由领域专家提供的单个标注样本。我们通过若干详细真实场景(包括医学图像分析与视觉质量保证)研究 SPAN。我们发现所得注意力掩码比源于领域无关预训练的掩码更具可解释性。SPAN 在肺与心脏分割上带来了 58.7 mAP 的提升。我们还发现,在将预训练模型迁移至下游胸部疾病分类任务时,相较领域无关预训练,我们的方法带来了 2.2 mAUC 的提升。最后,我们表明在低数据情形下,SPAN 预训练相较领域无关预训练带来了更高的下游分类性能。
引用
@article{arxiv.2209.03745,
title = {Prior Knowledge-Guided Attention in Self-Supervised Vision Transformers},
author = {Kevin Miao and Akash Gokul and Raghav Singh and Suzanne Petryk and Joseph Gonzalez and Kurt Keutzer and Trevor Darrell and Colorado Reed},
journal= {arXiv preprint arXiv:2209.03745},
year = {2022}
}