从语义视角解构视觉Transformer中的自注意力:分析与运用
计算机视觉与模式识别
2022-11-17 v1 人工智能
机器学习
摘要
自注意力机制,尤其是多头自注意力(MSA),已在计算机视觉与自然语言处理等诸多领域取得巨大成功。然而,许多现有视觉Transformer(ViT)工作简单沿用来自NLP的transformer设计以适应视觉任务,却忽视了“MSA在图像与语言场景中如何运作”的根本差异。语言天然包含高度语义结构,可被人类直接解释。其基本单元(词)是离散且无冗余信息的,这便于对语言transformer的MSA机制进行可解释研究。相比之下,视觉数据呈现根本不同的结构:其基本单元(像素)是自然低级表示,邻域内存在显著冗余,这给ViT中MSA机制的可解释性带来明显挑战。本文引入一种典型图像处理技术,即尺度不变特征变换(SIFT),将低级表示映射到中级空间,并标注具有丰富语义信息的广泛离散关键点。接着,我们构建基于SIFT关键点的加权块关联分析,以捕捉隐藏于不同语义浓度块中的注意力模式。有趣的是,我们发现该定量分析不仅是ViT中MSA机制可解释性的有效补充,还可应用于1)模型推理时的虚假关联发现与“提示”,2)引导式模型预训练加速。两项应用的实验结果均显示出优于基线的显著优势,证明了方法的有效性。
引用
@article{arxiv.2211.08543,
title = {Demystify Self-Attention in Vision Transformers from a Semantic Perspective: Analysis and Application},
author = {Leijie Wu and Song Guo and Yaohong Ding and Junxiao Wang and Wenchao Xu and Richard Yida Xu and Jie Zhang},
journal= {arXiv preprint arXiv:2211.08543},
year = {2022}
}
备注
10 pages, 11 figures