中文

RePre:通过重构预训练改进自监督视觉Transformer

计算机视觉与模式识别 2022-01-20 v2 人工智能

摘要

近年来,自监督视觉Transformer因其出色的表征学习能力而受到前所未有的关注。然而,主流方法对比学习主要依赖于实例判别代理任务,学习对图像的全局理解。本文通过重构预训练(RePre)将局部特征学习引入自监督视觉Transformer。我们的RePre在现有对比目标的基础上并行添加了一个用于重构原始图像像素的分支,从而扩展了对抗式框架。RePre配备了一个轻量的基于卷积的解码器,融合来自Transformer编码器的多层次特征。多层次特征提供了从低到高语义信息的丰富监督,这对我们的RePre至关重要。我们的RePre在各种具有不同视觉Transformer架构的对比框架上带来了显著提升。在下游任务中的迁移性能优于有监督预训练和当前最先进(SOTA)的自监督方法。

关键词

引用

@article{arxiv.2201.06857,
  title  = {RePre: Improving Self-Supervised Vision Transformer with Reconstructive Pre-training},
  author = {Luya Wang and Feng Liang and Yangguang Li and Honggang Zhang and Wanli Ouyang and Jing Shao},
  journal= {arXiv preprint arXiv:2201.06857},
  year   = {2022}
}