中文

多模态大型语言与视觉模型综述

计算与语言 2024-04-03 v1 人工智能

摘要

大型语言模型(LLM)最近因其前所未有的理解和生成类人文本的能力而成为研究和应用的焦点。最近,LLM被扩展为多模态大型语言模型(MM-LLM),使其能力扩展到处理图像、视频和音频信息,以及文本。这开启了文本到视频生成、图像描述、文本到语音等应用,并且可以通过为LLM增加多模态能力或从头构建MM-LLM来实现。本文对当前具有多模态能力的LLM以及最新的MM-LLM进行了广泛综述。涵盖了LLM的历史发展,特别是基于Transformer架构(如OpenAI的GPT系列和Google的BERT)所取得的进展,以及注意力机制在提升模型性能中的作用。本文涵盖了最重要的一些LLM和MM-LLM,并介绍了模型调优技术,包括微调和提示工程,这些技术将预训练模型定制到特定任务或领域。还分析了伦理考量和挑战,如数据偏差和模型滥用,以强调负责任AI开发和部署的重要性。最后,我们讨论了开源模型与专有模型在AI研究中的影响。通过本综述,我们提供了对MM-LLM在各种应用中变革潜力的见解。

关键词

引用

@article{arxiv.2404.01322,
  title  = {A Review of Multi-Modal Large Language and Vision Models},
  author = {Kilian Carolan and Laura Fennelly and Alan F. Smeaton},
  journal= {arXiv preprint arXiv:2404.01322},
  year   = {2024}
}

备注

33 pages, 1 figure