ERNIE-ViLG:面向双向视觉-语言生成的统一生成式预训练
计算机视觉与模式识别
2022-01-03 v1 计算与语言
摘要
传统的图文生成任务方法主要分别处理天然双向的生成任务,侧重于设计特定任务的框架以提升生成样本的质量与保真度。近来,视觉-语言预训练模型极大提升了图生文生成任务的性能,但用于文生图合成任务的大规模预训练模型仍发展不足。本文中,我们提出 ERNIE-ViLG,一种基于 transformer 模型的双向图文生成统一生成式预训练框架。基于图像量化模型,我们将图像生成与文本生成均公式化为以文本/图像输入为条件的自回归生成任务。双向图文生成建模简化了视觉与语言间的语义对齐。对于文生图生成过程,我们进一步提出端到端训练方法以联合学习视觉序列生成器与图像重建器。为探索大规模预训练用于双向图文生成的图景,我们在 1.45 亿(中文)图文对的大规模数据集上训练了 100 亿参数的 ERNIE-ViLG 模型,其在文生图与图生文任务上均取得最先进性能,在 MS-COCO 上文生图合成的 FID 为 7.9,并在 COCO-CN 与 AIC-ICC 上取得图像描述最佳结果。
引用
@article{arxiv.2112.15283,
title = {ERNIE-ViLG: Unified Generative Pre-training for Bidirectional Vision-Language Generation},
author = {Han Zhang and Weichong Yin and Yewei Fang and Lanxin Li and Boqiang Duan and Zhihua Wu and Yu Sun and Hao Tian and Hua Wu and Haifeng Wang},
journal= {arXiv preprint arXiv:2112.15283},
year = {2022}
}
备注
15 pages, 7 figures