中文

用于表征学习的高效自监督视觉Transformer

计算机视觉与模式识别 2022-07-08 v2 人工智能 机器学习

摘要

本文研究两种用于开发高效自监督视觉Transformer(EsViT)以进行视觉表征学习的技术。首先,我们通过全面的实证研究表明,具有稀疏自注意力的多阶段架构可显著降低建模复杂度,但代价是丧失捕捉图像区域间细粒度对应关系的能力。其次,我们提出一种新的区域匹配预训练任务,使模型能够捕捉细粒度区域依赖关系,从而显著提高所学视觉表征的质量。我们的结果表明,结合这两种技术,EsViT 在 ImageNet 线性探测评估中取得 81.3% 的 top-1 准确率,以约一个数量级更高的吞吐量优于先前方法。在迁移至下游线性分类任务时,EsViT 在 18 个数据集中有 17 个优于其有监督对应模型。代码与模型已公开:https://github.com/microsoft/esvit

关键词

引用

@article{arxiv.2106.09785,
  title  = {Efficient Self-supervised Vision Transformers for Representation Learning},
  author = {Chunyuan Li and Jianwei Yang and Pengchuan Zhang and Mei Gao and Bin Xiao and Xiyang Dai and Lu Yuan and Jianfeng Gao},
  journal= {arXiv preprint arXiv:2106.09785},
  year   = {2022}
}

备注

ICLR 2022; Code: https://github.com/microsoft/esvit