中文

在自监督视觉表征学习中通过 Transformer 复兴 CNN 注意力

计算机视觉与模式识别 2021-10-12 v1 机器学习

摘要

自监督视觉表征学习(SSL)的研究改进编码器骨干网络以在无标签情况下区分训练样本。尽管通过 SSL 的 CNN 编码器取得了与有监督学习相当识别性能,其网络注意力尚未被充分探索以进一步改进。受 Transformer 在识别场景中有效探索视觉注意力的启发,我们提出一种 CNN 注意力复兴(CARE)框架,在 SSL 中以 Transformer 为指导训练具注意力的 CNN 编码器。所提 CARE 框架由 CNN 流(C-stream)与 Transformer 流(T-stream)组成,每流含两个分支。C-stream 遵循已有 SSL 框架,含两个 CNN 编码器、两个投影器与一个预测器。T-stream 含两个 Transformer、两个投影器与一个预测器。T-stream 连接至 CNN 编码器并与其余 C-stream 并行。训练时我们在两流中同时执行 SSL,并用 T-stream 输出监督 C-stream。来自 CNN 编码器的特征在 T-stream 中被调制以增强视觉注意力并适用于 SSL 场景。我们利用这些调制特征监督 C-stream 以学习具注意力的 CNN 编码器。为此,我们通过以 Transformer 作为引导来复兴 CNN 注意力。在若干标准视觉识别基准(包括图像分类、目标检测与语义分割)上的实验表明,所提 CARE 框架将 CNN 编码器骨干网络提升至最先进性能。

关键词

引用

@article{arxiv.2110.05340,
  title  = {Revitalizing CNN Attentions via Transformers in Self-Supervised Visual Representation Learning},
  author = {Chongjian Ge and Youwei Liang and Yibing Song and Jianbo Jiao and Jue Wang and Ping Luo},
  journal= {arXiv preprint arXiv:2110.05340},
  year   = {2021}
}

备注

Accepted by NeurIPS 2021