中文

多模态基础模型:从专用模型到通用助手

计算机视觉与模式识别 2023-09-20 v1 计算与语言

摘要

本文对展现视觉与视觉-语言能力的多模态基础模型的分类与演进进行了全面综述,重点关注从专用模型到通用助手的转变。研究图景涵盖五个核心主题,分为两类。(i) 我们首先综述成熟的研究领域:为特定目的预训练的多模态基础模型,包括两个主题——用于视觉理解的视觉骨干网络学习方法与文本到图像生成。(ii) 随后,我们介绍探索性开放研究领域的近期进展:旨在扮演通用助手角色的多模态基础模型,包括三个主题——受大语言模型(LLM)启发的统一视觉模型、多模态LLM的端到端训练,以及将多模态工具与LLM链式结合。本文的目标读者是计算机视觉及视觉-语言多模态领域的研究人员、研究生与从业者,他们渴望了解多模态基础模型的基础知识与近期进展。

关键词

引用

@article{arxiv.2309.10020,
  title  = {Multimodal Foundation Models: From Specialists to General-Purpose Assistants},
  author = {Chunyuan Li and Zhe Gan and Zhengyuan Yang and Jianwei Yang and Linjie Li and Lijuan Wang and Jianfeng Gao},
  journal= {arXiv preprint arXiv:2309.10020},
  year   = {2023}
}

备注

119 pages, PDF file size 58MB; Tutorial website: https://vlp-tutorial.github.io/2023/