中文

浅层视觉层选择使多模态大语言模型表现更佳

计算机视觉与模式识别 2025-10-13 v2 人工智能

摘要

多模态大语言模型(MLLM)通常从预训练视觉变换器(ViT)的最后一层提取视觉特征。这种广泛的深层偏置主要是基于经验惯例,而非以原则性分析为导驱动。虽然先前的研究表明不同ViT层捕获不同类型的信息,其中浅层关注细节,深层更接近文本语义,但这种变化对MLLM性能的影响仍未得到充分探索。我们首次对视觉层选择进行全面研究,分析ViT各层的表示相似性,建立浅层、中层和深层的层次分组。通过对10个包含60+任务的MLLM(14亿-70亿参数)进行广泛评估,我们发现虽然深层在语义丰富的任务(如OCR)中表现突出,浅层和中层在细粒度视觉任务(如计数、定位和目标定位)中显著优于深层。基于这些见解,我们提出了一种轻量级特征融合方法,战略性地整合浅层特征,实现了对单层和专门融合基线的一致性改进。我们的工作为MLLM的视觉层选择提供了首个原则性研究,表明MLLM往往在浅层视觉层选择时表现更佳。

关键词

引用

@article{arxiv.2504.21447,
  title  = {Multimodal Language Models See Better When They Look Shallower},
  author = {Haoran Chen and Junyan Lin and Xinghao Chen and Yue Fan and Jianfeng Dong and Xin Jin and Hui Su and Jinlan Fu and Xiaoyu Shen},
  journal= {arXiv preprint arXiv:2504.21447},
  year   = {2025}
}

备注

9 pages, 6 figures, accepted by EMNLP2025