生成式多模态模型是上下文学习器
计算机视觉与模式识别
2024-05-09 v2
摘要
人类能够轻松地在上下文中解决多模态任务(即仅需少量示例或简单指令),而当前的多模态系统在很大程度上难以模仿这一能力。在本研究中,我们证明了通过有效的规模扩展,可以显著增强大型多模态模型的任务无关上下文学习能力。我们提出了 Emu2,一个具有 370 亿参数的生成式多模态模型,该模型使用统一的回归目标在大规模多模态序列上进行训练。Emu2 展现出强大的多模态上下文学习能力,甚至能涌现出解决需要即时推理的任务,例如视觉提示和以对象为锚定的生成。该模型在少样本设置下的多个多模态理解任务中创下了新纪录。在经过指令微调以遵循特定指令后,Emu2 在具有挑战性的任务上进一步实现了新的 SOTA,例如大型多模态模型的问答基准测试和开放式主体驱动生成。这些成就表明,Emu2 可以作为基础模型和通用接口,适用于广泛的多模态任务。代码和模型已公开,以促进未来的研究。
引用
@article{arxiv.2312.13286,
title = {Generative Multimodal Models are In-Context Learners},
author = {Quan Sun and Yufeng Cui and Xiaosong Zhang and Fan Zhang and Qiying Yu and Zhengxiong Luo and Yueze Wang and Yongming Rao and Jingjing Liu and Tiejun Huang and Xinlong Wang},
journal= {arXiv preprint arXiv:2312.13286},
year = {2024}
}
备注
Accepted to CVPR 2024. Project page: https://baaivision.github.io/emu2