中文

用于视觉识别的上下文Transformer网络

计算机视觉与模式识别 2021-07-27 v1 人工智能 机器学习 多媒体

摘要

具有自注意力的Transformer已引发自然语言处理领域的变革,且近来启发了在众多计算机视觉任务中取得有竞争力结果的Transformer风格架构设计。然而,现有大多数设计直接在2D特征图上施加自注意力,基于每个空间位置处孤立的查询与键对获得注意力矩阵,却未充分利用相邻键之间的丰富上下文。本文设计了一种新颖的Transformer风格模块,即上下文Transformer(CoT)块,用于视觉识别。该设计充分利用输入键之间的上下文信息来引导动态注意力矩阵的学习,从而增强视觉表征能力。在技术上,CoT块首先通过3×33\times3卷积对输入键进行上下文编码,得到输入的静态上下文表征。我们进一步将编码后的键与输入查询拼接,通过两个连续的1×11\times1卷积学习动态多头注意力矩阵。学习到的注意力矩阵与输入值相乘,实现输入的动态上下文表征。静态与动态上下文表征的融合最终作为输出。我们的CoT块具有吸引力之处在于,它可轻易替换ResNet架构中的每个3×33\times3卷积,从而产生名为上下文Transformer网络(CoTNet)的Transformer风格骨干网络。通过在广泛应用(如图像识别、目标检测与实例分割)上的大量实验,我们验证了CoTNet作为更强骨干网络的优越性。源代码见\url{https://github.com/JDAI-CV/CoTNet}。

关键词

引用

@article{arxiv.2107.12292,
  title  = {Contextual Transformer Networks for Visual Recognition},
  author = {Yehao Li and Ting Yao and Yingwei Pan and Tao Mei},
  journal= {arXiv preprint arXiv:2107.12292},
  year   = {2021}
}

备注

Rank 1 in open-set image classification task of Open World Vision Challenge @ CVPR 2021; The source code and models are publicly available at: \url{https://github.com/JDAI-CV/CoTNet}