多模态大语言模型综述
计算机视觉与模式识别
2024-12-02 v4 人工智能
计算与语言
机器学习
摘要
近来,以GPT-4V为代表的多模态大语言模型(MLLM)已成为新兴的研究热点,其使用强大的大语言模型(LLM)作为大脑来执行多模态任务。MLLM令人惊讶的涌现能力,如基于图像写故事与免OCR的数学推理,在传统多模态方法中罕见,暗示了通向通用人工智能的潜在路径。为此,学术界与工业界均努力开发可媲美甚至超越GPT-4V的MLLM,以惊人速度推进研究极限。本文旨在追踪并总结MLLM的近期进展。首先,我们给出MLLM的基本公式并描绘其相关概念,包括架构、训练策略与数据以及评估。随后,我们介绍关于MLLM如何扩展以支持更细粒度、更多模态、更多语言与更多场景的研究主题。我们继续讨论多模态幻觉与扩展技术,包括多模态上下文学习(M-ICL)、多模态思维链(M-CoT)与LLM辅助视觉推理(LAVR)。为总结本文,我们讨论现有挑战并指出有前景的研究方向。鉴于MLLM时代方才开始,我们将持续更新本综述并希望其能启发更多研究。收集最新论文的相关GitHub链接见 https://github.com/BradyFU/Awesome-Multimodal-Large-Language-Models。
引用
@article{arxiv.2306.13549,
title = {A Survey on Multimodal Large Language Models},
author = {Shukang Yin and Chaoyou Fu and Sirui Zhao and Ke Li and Xing Sun and Tong Xu and Enhong Chen},
journal= {arXiv preprint arXiv:2306.13549},
year = {2024}
}
备注
Accepted for publication in National Science Review. Project page:https://github.com/BradyFU/Awesome-Multimodal-Large-Language-Models