从图像描述文本训练视觉-语言 Transformer
计算机视觉与模式识别
2023-06-16 v3 多媒体
摘要
视觉-语言 Transformer 可以在无需低级人类标注(如类别标签、边界框等)的情况下学习。现有工作无论显式利用边界框还是图像块,都假设视觉骨干网络必须先在 ImageNet 类别预测上训练,然后才能集成到多模态语言流水线中。我们表明这并非必要,并提出了一种构建于 Masked Auto-Encoders 之上的新模型 Vision-Language from Captions (VLC),其不需要此类监督。事实上,在针对当前最先进的基于图像块、使用有监督目标分类预训练的视觉-语言 transformer ViLT 与我们的模型 VLC 的面对面比较中,我们发现我们的方法:1. 在标准基准上优于 ViLT;2. 提供了更具可解释性和直观性的图像块可视化;3. 与许多利用在标注边界框上训练的 ROI 的更大模型具有竞争力。
引用
@article{arxiv.2205.09256,
title = {Training Vision-Language Transformers from Captions},
author = {Liangke Gui and Yingshan Chang and Qiuyuan Huang and Subhojit Som and Alex Hauptmann and Jianfeng Gao and Yonatan Bisk},
journal= {arXiv preprint arXiv:2205.09256},
year = {2023}
}