探索随机自回归图像建模用于视觉表征学习
计算机视觉与模式识别
2022-12-06 v1 人工智能
摘要
自回归语言建模(ALM)已成功用于自然语言处理(NLP)中的自监督预训练。然而,该范式在计算机视觉中未取得与其他自监督方法(如对比学习、掩码图像建模)相当的结果。本文试图找出自回归建模在视觉任务上表现不佳的原因。为解决该问题,我们充分分析了视觉自回归方法的局限性,并通过两个简单设计提出了一种新颖的随机自回归图像建模(称为SAIM)。首先,我们采用随机排列策略生成有效且鲁棒的图像上下文,这对视觉任务至关重要。其次,我们创建了并行编码器-解码器训练过程,其中编码器扮演类似于标准vision transformer的角色,专注于学习整体上下文信息,同时解码器预测当前位置的内容,从而使编码器与解码器相互增强。通过引入随机预测与并行编码器-解码器,SAIM显著提升了自回归图像建模的性能。我们的方法在仅使用ImageNet-1K数据的方法中,于原始ViT-Base模型上取得了最佳准确率(83.9%)。下游任务的迁移性能也表明我们的模型具有竞争力。
引用
@article{arxiv.2212.01610,
title = {Exploring Stochastic Autoregressive Image Modeling for Visual Representation},
author = {Yu Qi and Fan Yang and Yousong Zhu and Yufei Liu and Liwei Wu and Rui Zhao and Wei Li},
journal= {arXiv preprint arXiv:2212.01610},
year = {2022}
}
备注
Accepted by AAAI 2023