面向图像描述与VQA的统一视觉-语言预训练
计算机视觉与模式识别
2019-12-05 v3
摘要
本文提出一种统一的视觉-语言预训练(VLP)模型。该模型之统一在于:(1)它可微调用于视觉-语言生成(如图像描述)或理解(如视觉问答)任务;(2)它使用共享的多层transformer网络进行编码与解码,这与许多采用独立模型实现编码器与解码器的现有方法不同。该统一VLP模型在大量图像-文本对上,利用双向与序列到序列(seq2seq)掩码视觉-语言预测这两个任务的无监督学习目标进行预训练。两任务仅有的区别在于预测所基于的上下文不同。这通过为共享transformer网络使用特定的自注意力掩码来控制。据我们所知,VLP是首个被报道的在图像描述与视觉问答等差异显著的视觉-语言生成与理解任务上,于COCO Captions、Flickr30k Captions和VQA 2.0三个具挑战性基准数据集均取得SOTA结果的模型。代码与预训练模型可在 https://github.com/LuoweiZhou/VLP 获取。
引用
@article{arxiv.1909.11059,
title = {Unified Vision-Language Pre-Training for Image Captioning and VQA},
author = {Luowei Zhou and Hamid Palangi and Lei Zhang and Houdong Hu and Jason J. Corso and Jianfeng Gao},
journal= {arXiv preprint arXiv:1909.11059},
year = {2019}
}
备注
AAAI 2020 camera-ready version. The code and the pre-trained models are available at https://github.com/LuoweiZhou/VLP