中文

多模态大语言模型的革命:综述

计算机视觉与模式识别 2024-06-07 v2 人工智能 计算与语言 多媒体

摘要

连接文本和视觉模态在生成式智能中起着至关重要的作用。因此,受大语言模型成功的启发,大量的研究工作致力于多模态大语言模型(MLLMs)的开发。这些模型能够无缝集成视觉和文本模态,同时提供基于对话的接口和指令遵循能力。在本文中,我们对近期基于视觉的 MLLMs 进行了全面综述,分析了它们的架构选择、多模态对齐策略和训练技术。我们还对这些模型在广泛任务中的表现进行了详细分析,包括视觉定位、图像生成与编辑、视觉理解以及特定领域的应用。此外,我们汇编并描述了训练数据集和评估基准,并在性能和计算需求方面对现有模型进行了比较。总体而言,本综述提供了当前技术水平的全面概述,为未来 MLLMs 的发展奠定了基础。

关键词

引用

@article{arxiv.2402.12451,
  title  = {The Revolution of Multimodal Large Language Models: A Survey},
  author = {Davide Caffagni and Federico Cocchi and Luca Barsellotti and Nicholas Moratelli and Sara Sarto and Lorenzo Baraldi and Lorenzo Baraldi and Marcella Cornia and Rita Cucchiara},
  journal= {arXiv preprint arXiv:2402.12451},
  year   = {2024}
}

备注

ACL 2024 (Findings)