用于视觉表示学习的语义感知自回归图像建模
计算机视觉与模式识别
2023-12-19 v1
摘要
在自监督预训练中,自回归建模(AM)在计算机视觉领域的发展落后于自然语言处理(NLP)。这主要是由于图像不是序列信号,在应用自回归建模时缺乏自然的顺序。在本研究中,受人类把握图像方式(即首先关注主要对象)的启发,我们提出了一种语义感知自回归图像建模(SemAIM)方法来应对这一挑战。SemAIM 的关键洞察是从语义块到较少语义块对图像进行自回归建模。为此,我们首先根据块的特征相似度计算语义感知的块排列,然后基于该排列执行自回归过程。此外,考虑到块的原始像素是低级信号,不是学习高级语义表示的理想预测目标,我们还探索了利用块特征作为预测目标。我们在广泛的下游任务上进行了大量实验,包括图像分类、目标检测和实例/语义分割,以评估 SemAIM 的性能。结果表明,与其他自监督方法相比,SemAIM 实现了 SOTA 性能。具体而言,使用 ViT-B,SemAIM 在 ImageNet 上微调的 top-1 准确率达到 84.1%,在 COCO 上目标检测和实例分割的 AP 分别为 51.3% 和 45.4%,分别比原始 MAE 高出 0.5%、1.0% 和 0.5%。
引用
@article{arxiv.2312.10457,
title = {Semantic-Aware Autoregressive Image Modeling for Visual Representation Learning},
author = {Kaiyou Song and Shan Zhang and Tong Wang},
journal= {arXiv preprint arXiv:2312.10457},
year = {2023}
}
备注
Accepted by AAAI2024