中文

MAGVLT:掩码生成式视觉与语言 Transformer

计算机视觉与模式识别 2023-03-23 v1 计算与语言 机器学习

摘要

尽管基于多模态图像-文本数据的生成建模已借助大规模配对数据集积极发展,但尝试用单一模型生成图像和文本数据、而非以一固定模态为条件生成另一模态的尝试仍很有限。本文中,我们探索一种可同时生成图像和文本序列的统一生成式视觉与语言(VL)模型。特别地,我们提出一种基于非自回归掩码预测的生成式 VL Transformer,名为 MAGVLT,并将其与自回归生成式 VL Transformer(ARGVLT)比较。相较于 ARGVLT,所提 MAGVLT 支持双向上下文编码、通过迭代精化中并行 token 预测实现快速解码,以及图像与文本填充等扩展编辑能力。为从零开始严谨训练我们的 MAGVLT 与图像-文本对,我们结合了图像到文本、文本到图像及联合图像-文本掩码预测任务。此外,我们基于步展开掩码预测和两图像-文本对混合上的选择性预测设计了两个额外任务。在 VL 基准各类下游生成任务上的实验结果表明,即便推理速度显著提升,我们的 MAGVLT 仍大幅优于 ARGVLT。特别地,MAGVLT 仅用一个中等规模模型(少于 5 亿参数)即在 MS-COCO 的零样本图像到文本和文本到图像生成任务上取得具竞争力结果,即便未使用单模态数据与网络。

关键词

引用

@article{arxiv.2303.12208,
  title  = {MAGVLT: Masked Generative Vision-and-Language Transformer},
  author = {Sungwoong Kim and Daejin Jo and Donghoon Lee and Jongmin Kim},
  journal= {arXiv preprint arXiv:2303.12208},
  year   = {2023}
}

备注

CVPR 2023