中文

面向图像描述与VQA的统一视觉-语言预训练

计算机视觉与模式识别 2019-12-05 v3

摘要

本文提出一种统一的视觉-语言预训练(VLP)模型。该模型之统一在于:(1)它可微调用于视觉-语言生成(如图像描述)或理解(如视觉问答)任务;(2)它使用共享的多层transformer网络进行编码与解码,这与许多采用独立模型实现编码器与解码器的现有方法不同。该统一VLP模型在大量图像-文本对上,利用双向与序列到序列(seq2seq)掩码视觉-语言预测这两个任务的无监督学习目标进行预训练。两任务仅有的区别在于预测所基于的上下文不同。这通过为共享transformer网络使用特定的自注意力掩码来控制。据我们所知,VLP是首个被报道的在图像描述与视觉问答等差异显著的视觉-语言生成与理解任务上,于COCO Captions、Flickr30k Captions和VQA 2.0三个具挑战性基准数据集均取得SOTA结果的模型。代码与预训练模型可在 https://github.com/LuoweiZhou/VLP 获取。

关键词

引用

@article{arxiv.1909.11059,
  title  = {Unified Vision-Language Pre-Training for Image Captioning and VQA},
  author = {Luowei Zhou and Hamid Palangi and Lei Zhang and Houdong Hu and Jason J. Corso and Jianfeng Gao},
  journal= {arXiv preprint arXiv:1909.11059},
  year   = {2019}
}

备注

AAAI 2020 camera-ready version. The code and the pre-trained models are available at https://github.com/LuoweiZhou/VLP