中文

高效整合大语言模型与视觉感知:训练范式视角下的综述

计算机视觉与模式识别 2025-02-05 v1 人工智能 计算与语言 机器学习

摘要

视觉-语言模态的整合一直是多模态学习的重点,传统上依赖于视觉-语言预训练模型。然而,随着大语言模型(LLMs)的出现,将LLMs与视觉模态结合的趋势日益显著。随之而来的是,将视觉模态融入LLMs的训练范式也在不断演变。最初的方法是通过预训练模态整合器来融合模态,称为单阶段微调。此后,该方法分化为侧重于性能提升的方法,即两阶段微调,以及优先考虑参数效率的方法,即直接适配。然而,现有的综述主要关注采用两阶段微调的最新视觉大语言模型(VLLMs),对于训练范式的演变及其独特的参数效率考量仍缺乏理解。本文从训练范式的视角出发,对来自顶级会议、期刊及高被引Arxiv论文的34个VLLMs进行了分类和回顾,重点关注适配过程中的参数效率。我们首先介绍了LLMs的架构和参数高效学习方法,随后讨论了视觉编码器,并对模态整合器进行了全面的分类。接着,我们回顾了三种训练范式及其效率考量,并总结了VLLM领域的基准测试。为更深入地理解它们在参数效率方面的有效性,我们比较并讨论了代表性模型的实验结果,其中复现了直接适配范式的实验。本综述提供了对近期发展和实际应用的见解,是研究人员和实践者在将视觉模态高效整合到LLMs过程中的重要指南。

关键词

引用

@article{arxiv.2502.01524,
  title  = {Efficiently Integrate Large Language Models with Visual Perception: A Survey from the Training Paradigm Perspective},
  author = {Xiaorui Ma and Haoran Xie and S. Joe Qin},
  journal= {arXiv preprint arXiv:2502.01524},
  year   = {2025}
}

备注

28 pages, 3 figures