中文

拓展多模态大语言模型视觉先验知识的边界

计算机视觉与模式识别 2025-06-02 v2 计算与语言

摘要

视觉编码器的先验知识是否限制了多模态大语言模型(MLLMs)的能力边界?虽然大多数现有研究将 MLLMs 视为通过端到端训练优化的统一系统,但关于视觉编码器先验知识影响的研究寥寥无计。本文提出一种新度量标准 Ranke\mathrm{Rank}_e,用于量化视觉编码器先验知识对 MLLM 性能的影响。我们的分析揭示了先验知识与 MLLM 性能之间的正相关性。此外,我们发现仅使用端到端视觉问答(VQA)数据进行的领域特定微调对于视觉先验知识较低的实体仍不够。为此,我们提出 VisPRE(Vision Prior Remediation),即一种两阶段训练框架,显式地在视觉编码器层面融合先验知识。实验结果表明,增强视觉编码器的先验知识可显著提升 MLLMs 的视觉理解能力,为提升性能(尤其是针对不寻常视觉实体)提供了一种新颖且高效的方法。

关键词

引用

@article{arxiv.2503.18034,
  title  = {Expanding the Boundaries of Vision Prior Knowledge in Multi-modal Large Language Models},
  author = {Qiao Liang and Yanjiang Liu and Weixiang Zhou and Ben He and Yaojie Lu and Hongyu Lin and Jia Zheng and Xianpei Han and Le Sun and Yingfei Sun},
  journal= {arXiv preprint arXiv:2503.18034},
  year   = {2025}
}