Emu:多模态中的生成式预训练
计算机视觉与模式识别
2024-05-09 v2
摘要
我们提出Emu,一种基于Transformer的多模态基础模型,可在多模态上下文中无缝生成图像与文本。该全能模型可通过“一模型适用全部”的自回归训练过程,无差别地接收任意单模态或多模态数据输入(例如交错的图像、文本与视频)。首先,视觉信号被编码为嵌入,并与文本词元共同构成交错输入序列。随后Emu以统一目标端到端训练:对多模态序列中的下一个文本词元进行分类,或对下一个视觉嵌入进行回归。这种灵活的多模态性支持大规模探索多样化预训练数据源,如带交错帧与文本的视频、带交错图像与文本的网页,以及网络规模的图文对与视频文本对。Emu可作为图像到文本与文本到图像任务的通用多模态接口,并支持上下文中的图像与文本生成。在图像描述、视觉问答、视频问答与文本到图像生成等广泛零样本/少样本任务中,Emu相较最先进的大型多模态模型展现出卓越性能。通过指令微调实现的多模态助手等扩展能力也展现出令人印象深刻的性能。
引用
@article{arxiv.2307.05222,
title = {Emu: Generative Pretraining in Multimodality},
author = {Quan Sun and Qiying Yu and Yufeng Cui and Fan Zhang and Xiaosong Zhang and Yueze Wang and Hongcheng Gao and Jingjing Liu and Tiejun Huang and Xinlong Wang},
journal= {arXiv preprint arXiv:2307.05222},
year = {2024}
}
备注
Accepted to ICLR 2024. Code and Models: https://github.com/baaivision/Emu