中文

为开放词汇任务预训练图像-语言 Transformer

计算机视觉与模式识别 2022-09-12 v1

摘要

我们提出了一种基于多种任务混合的视觉与语言 Transformer 模型的预训练方法。我们探索了在预训练中使用无需额外监督的图像-文本描述数据的做法,以及用于预训练模型的对象感知策略。我们在若干文本生成式视觉+语言任务上评估了该方法,例如视觉问答、视觉蕴涵与描述生成,并展示了相较标准预训练方法的巨大增益。

关键词

引用

@article{arxiv.2209.04372,
  title  = {Pre-training image-language transformers for open-vocabulary tasks},
  author = {AJ Piergiovanni and Weicheng Kuo and Anelia Angelova},
  journal= {arXiv preprint arXiv:2209.04372},
  year   = {2022}
}