中文

将 image-GPT 重塑为强大的视觉表示学习器

计算机视觉与模式识别 2024-07-08 v2

摘要

本文增强了 image-GPT (iGPT),这是引入自回归预训练以预测下一像素来进行视觉表示学习的先驱性工作之一。我们做出了两个简单但关键的改变。首先,我们将预测目标从原始像素转移到语义词元,从而实现对视觉内容的更高层次理解。其次,我们通过指导模型不仅预测下一词元,还预测可见词元,来补充自回归建模。当语义词元由判别式训练模型(如 CLIP)编码时,此流程尤为有效。我们将这种新颖的方法称为 D-iGPT。大量实验表明,D-iGPT 作为强大的视觉表示学习器表现出色:一项显著的成就是其在 ImageNet-1K 数据集上的优异表现——通过在公开可用的数据集上进行训练,D-iGPT 以前所未有的方式使用普通的 ViT-H 实现了 \textbf{90.0\%} 的 top-1 准确率。此外,D-iGPT 在下游任务上表现出强大的泛化能力。代码可在 https://github.com/OliverRensu/D-iGPT 获取。

关键词

引用

@article{arxiv.2312.02147,
  title  = {Rejuvenating image-GPT as Strong Visual Representation Learners},
  author = {Sucheng Ren and Zeyu Wang and Hongru Zhu and Junfei Xiao and Alan Yuille and Cihang Xie},
  journal= {arXiv preprint arXiv:2312.02147},
  year   = {2024}
}

备注

This paper is accepted by ICML2024