DU-VLG:通过双序列到序列预训练统一视觉与语言生成
计算机视觉与模式识别
2022-03-18 v1 人工智能
计算与语言
摘要
由于模型结构与预训练目标的局限,现有视觉与语言生成模型无法通过双向生成利用成对的图文数据。本文提出 DU-VLG,一种将视觉与语言生成统一为序列生成问题的框架。DU-VLG 采用新颖的双预训练任务训练:多模态去噪自编码任务与模态翻译任务。为弥合图像理解与生成间的鸿沟,我们进一步设计了一种新颖的承诺损失(commitment loss)。我们在图像描述与文本到图像生成数据集上比较了预训练目标。结果表明,DU-VLG 优于使用单向生成目标训练的变体或不带承诺损失的变体。在三个视觉与语言生成任务上,我们也取得了比先前最优系统更高的分数。此外,人工评测进一步确认我们的模型生成了真实且相关的图像以及忠实且信息丰富的描述。
引用
@article{arxiv.2203.09052,
title = {DU-VLG: Unifying Vision-and-Language Generation via Dual Sequence-to-Sequence Pre-training},
author = {Luyang Huang and Guocheng Niu and Jiachen Liu and Xinyan Xiao and Hua Wu},
journal= {arXiv preprint arXiv:2203.09052},
year = {2022}
}
备注
To appear at Findings of ACL 2022