中文

VL-GPT:用于视觉与语言理解及生成的生成式预训练Transformer

计算机视觉与模式识别 2023-12-15 v1

摘要

在这项工作中,我们引入了视觉-语言生成式预训练Transformer(VL-GPT),这是一种能够同时感知和生成视觉与语言数据的Transformer模型。VL-GPT通过采用简单的自回归目标,实现了图像和文本模态的统一预训练方法,从而使模型能够像语言模型处理文本一样无缝地处理图像和文本。为此,我们首先提出了一种新颖的图像分词器-逆分词器框架,专门用于将原始图像转换为连续的嵌入序列并相应地重建它们。结合现有的文本分词器和逆分词器,该框架允许将交错的图像-文本数据编码为多模态序列,随后可以输入到Transformer模型中。因此,VL-GPT可以利用统一的自回归目标(即下一个词元预测)在多模态语料库上进行大规模预训练。预训练完成后,VL-GPT在多种视觉和语言理解及生成任务中展现出卓越的零样本和少样本性能,包括图像描述、视觉问答、文本到图像生成等。此外,预训练模型在提供多模态提示时保留了上下文学习能力。我们进一步对VL-GPT进行了指令微调,展示了其在多模态辅助方面的非凡潜力。源代码和模型权重将发布。

关键词

引用

@article{arxiv.2312.09251,
  title  = {VL-GPT: A Generative Pre-trained Transformer for Vision and Language Understanding and Generation},
  author = {Jinguo Zhu and Xiaohan Ding and Yixiao Ge and Yuying Ge and Sijie Zhao and Hengshuang Zhao and Xiaohua Wang and Ying Shan},
  journal= {arXiv preprint arXiv:2312.09251},
  year   = {2023}
}