M-VADER:一个具有多模态上下文的扩散模型
计算机视觉与模式识别
2022-12-08 v2
摘要
我们介绍了 M-VADER:一个用于图像生成的扩散模型(DM),其输出可使用任意组合的图像与文本来指定。我们展示了 M-VADER 如何支持使用图像与文本组合以及多图像组合来生成图像。此前,已引入若干成功的 DM 图像生成算法,使得使用文本提示指定输出图像成为可能。受这些模型成功的启发,并基于语言已被发展用来描述人类认为最重要的视觉上下文要素这一观念,我们引入了一个与视觉-语言模型密切相关的嵌入模型。具体而言,我们引入嵌入模型 S-MAGMA:一个 130 亿参数的多模态解码器,结合了自回归视觉-语言模型 MAGMA 的组件和为语义搜索微调的偏置。
引用
@article{arxiv.2212.02936,
title = {M-VADER: A Model for Diffusion with Multimodal Context},
author = {Samuel Weinbach and Marco Bellagente and Constantin Eichenberg and Andrew Dai and Robert Baldock and Souradeep Nanda and Björn Deiseroth and Koen Oostermeijer and Hannah Teufel and Andres Felipe Cruz-Salinas},
journal= {arXiv preprint arXiv:2212.02936},
year = {2022}
}
备注
22 pages, 14 figures, 2 tables, fixed figure 3