书写与绘画:生成式视觉-语言模型是统一的模态学习器
计算机视觉与模式识别
2023-02-20 v3 计算与语言
机器学习
摘要
视觉-语言预训练的最新进展推动了各类视觉-语言任务的最先进水平,使机器更擅长多模态书写(图像到文本生成)与绘画(文本到图像生成)。然而,鲜有研究探讨这两种基本能力能否被共同学习并相互提升,从而构建通用且强大的多模态基础模型。本工作中,我们揭示了对称生成式视觉-语言预训练在同时学习书写与绘画方面的潜力,并提出一种名为 DaVinci 的新型统一模态模型,其以前缀语言建模与前缀图像建模——一种在图像-文本对上的简单生成式自监督目标——进行训练。得益于所提前缀多模态建模框架,DaVinci 训练简单、可扩展至海量数据、适配书写与绘画任务,并且在其他视觉、文本及多模态理解任务上同样表现强劲。DaVinci 在广泛的 27 项生成/理解任务上取得有竞争力的性能,并展示了结合视觉/语言生成式预训练的优势。此外,我们细致地基准测试了不同视觉-语言预训练目标在不同规模预训练数据集上、于异构且广泛分布覆盖下的性能。我们的结果展示了利用语言与视觉输入中自监督的潜力,并为不同数据规模下的未来比较建立了新的、更强的基线。代码与预训练模型见 https://github.com/shizhediao/DaVinci。
引用
@article{arxiv.2206.07699,
title = {Write and Paint: Generative Vision-Language Models are Unified Modal Learners},
author = {Shizhe Diao and Wangchunshu Zhou and Xinsong Zhang and Jiawei Wang},
journal= {arXiv preprint arXiv:2206.07699},
year = {2023}
}
备注
ICLR 2023