中文

面向大型视觉语言模型的指令引导的多层视觉特征融合

计算机视觉与模式识别 2025-01-20 v3 机器学习

摘要

大型视觉语言模型(LVLMs)通过集成预训练视觉编码器和大语言模型,在广泛的多模态任务中取得了显著的成功。然而,当前的LVLMs主要依赖视觉编码器最终层提取的视觉特征,忽略了浅层可用的最佳补充信息。虽然最近的研究尝试在LVLMs中运用多层视觉特征,但这些方法往往是任务无关的,未能检视层次视觉特征与特定任务之间的依赖关系。为解决这些问题,本文系统性地研究了来自不同编码器层的视觉特征贡献,基于18个覆盖6个任务类别的基准测试。我们的发现表明,多层特征在不同任务依赖性下提供互补的优势,统一融合会导致次优性能。基于这些洞见,我们提出了指令引导的视觉聚合器模块,根据文本指令动态集成多层视觉特征,而无需增加视觉标记的数量。广泛的评估表明,我们的方法性能卓越。此外,对聚合器行为的深入分析揭示了语义丰富任务中中到高层次特征的主导地位,以及细粒度感知中低层次特征的关键作用。

关键词

引用

@article{arxiv.2501.08443,
  title  = {Instruction-Guided Fusion of Multi-Layer Visual Features in Large Vision-Language Models},
  author = {Xu Li and Yi Zheng and Haotian Chen and Xiaolei Chen and Yuxuan Liang and Chenghang Lai and Bin Li and Xiangyang Xue},
  journal= {arXiv preprint arXiv:2501.08443},
  year   = {2025}
}