VirTex:从文本标注中学习视觉表征
计算机视觉与模式识别
2021-09-28 v3 计算与语言
摘要
许多视觉任务的事实标准方法是从预训练的视觉表征出发,通常通过 ImageNet 上的有监督训练获得。近期方法探索了无监督预训练以扩展到大量未标注图像。相反,我们旨在用更少的图像学习高质量视觉表征。为此,我们重审有监督预训练,并寻求基于分类的预训练的数据高效替代方案。我们提出 VirTex——一种利用语义稠密标注文本学习视觉表征的预训练方法。我们从零开始在 COCO Captions 上训练卷积网络,并将其迁移到下游识别任务,包括图像分类、目标检测和实例分割。在所有任务上,VirTex 产生的特征匹配或超越在 ImageNet 上学习的特征(无论有监督或无监督),尽管使用的图像最多少十倍。
引用
@article{arxiv.2006.06666,
title = {VirTex: Learning Visual Representations from Textual Annotations},
author = {Karan Desai and Justin Johnson},
journal= {arXiv preprint arXiv:2006.06666},
year = {2021}
}
备注
CVPR 2021. [v3: better captioning results on fixing beam search bug]