XGPT:面向图像描述生成的跨模态生成式预训练
计算与语言
2020-03-05 v2 计算机视觉与模式识别
机器学习
摘要
尽管许多基于 BERT 的跨模态预训练模型在图像-文本检索和 VQA 等下游理解任务上取得了优异结果,它们无法直接应用于生成任务。本文中,我们提出 XGPT,一种用于图像描述生成的跨模态生成式预训练新方法,旨在通过三种新颖的生成任务——图像条件掩码语言建模(IMLM)、图像条件去噪自编码(IDA)和文本条件图像特征生成(TIFG)——预训练文本到图像描述生成器。因此,预训练后的 XGPT 可在不进行任何任务特定架构修改的情况下微调,以创建图像描述的最先进模型。实验表明,XGPT 在包括 COCO Captions 和 Flickr30k Captions 在内的基准数据集上取得了新的 SOTA 结果。我们还使用 XGPT 生成新的图像描述作为数据增强用于图像检索任务,并在所有召回指标上取得显著提升。
引用
@article{arxiv.2003.01473,
title = {XGPT: Cross-modal Generative Pre-Training for Image Captioning},
author = {Qiaolin Xia and Haoyang Huang and Nan Duan and Dongdong Zhang and Lei Ji and Zhifang Sui and Edward Cui and Taroon Bharti and Xin Liu and Ming Zhou},
journal= {arXiv preprint arXiv:2003.01473},
year = {2020}
}
备注
12 pages, 3 figures, 7 tables