中文

面向大语言模型中心的多模态融合:集成策略与技术综述

计算与语言 2025-06-06 v1 人工智能 机器学习

摘要

多模态大语言模型(MLLMs)的快速发展已改变了人工智能领域的格局。这些模型将预训练的大语言模型与各种模态编码器相结合。这种集成需要系统性地理解不同模态如何连接到语言主干。我们的综述提供了一种以大语言模型为中心的分析视角。我们考察了将不同模态输入转换为语言嵌入空间的变换和对齐方法。这一工作填补了现有文献中的重要空白。我们提出了基于三个关键维度的MLLMs分类框架。首先,我们检查了模态集成的架构策略,包括具体的集成机制和融合水平。其次,我们将表示学习技术分类为联合表示或坐标表示。第三,我们分析了训练范式,包括训练策略和目标函数。通过考察2021年至2025年间开发的125个MLLMs,我们确定了该领域的新兴模式。我们的分类体系为研究人员提供了当前集成技术的结构化概览。这些见解旨在指导未来基于预训练基础模型开发更健壮的多模态集成策略。

关键词

引用

@article{arxiv.2506.04788,
  title  = {Towards LLM-Centric Multimodal Fusion: A Survey on Integration Strategies and Techniques},
  author = {Jisu An and Junseok Lee and Jeoungeun Lee and Yongseok Son},
  journal= {arXiv preprint arXiv:2506.04788},
  year   = {2025}
}

备注

18 pages, 3 figures, 3 tables