中文

探索随机自回归图像建模用于视觉表征学习

计算机视觉与模式识别 2022-12-06 v1 人工智能

摘要

自回归语言建模(ALM)已成功用于自然语言处理(NLP)中的自监督预训练。然而,该范式在计算机视觉中未取得与其他自监督方法(如对比学习、掩码图像建模)相当的结果。本文试图找出自回归建模在视觉任务上表现不佳的原因。为解决该问题,我们充分分析了视觉自回归方法的局限性,并通过两个简单设计提出了一种新颖的随机自回归图像建模(称为SAIM)。首先,我们采用随机排列策略生成有效且鲁棒的图像上下文,这对视觉任务至关重要。其次,我们创建了并行编码器-解码器训练过程,其中编码器扮演类似于标准vision transformer的角色,专注于学习整体上下文信息,同时解码器预测当前位置的内容,从而使编码器与解码器相互增强。通过引入随机预测与并行编码器-解码器,SAIM显著提升了自回归图像建模的性能。我们的方法在仅使用ImageNet-1K数据的方法中,于原始ViT-Base模型上取得了最佳准确率(83.9%)。下游任务的迁移性能也表明我们的模型具有竞争力。

关键词

引用

@article{arxiv.2212.01610,
  title  = {Exploring Stochastic Autoregressive Image Modeling for Visual Representation},
  author = {Yu Qi and Fan Yang and Yousong Zhu and Yufei Liu and Liwei Wu and Rui Zhao and Wei Li},
  journal= {arXiv preprint arXiv:2212.01610},
  year   = {2022}
}

备注

Accepted by AAAI 2023