拓展多模态大语言模型视觉先验知识的边界
计算机视觉与模式识别
2025-06-02 v2 计算与语言
摘要
视觉编码器的先验知识是否限制了多模态大语言模型(MLLMs)的能力边界?虽然大多数现有研究将 MLLMs 视为通过端到端训练优化的统一系统,但关于视觉编码器先验知识影响的研究寥寥无计。本文提出一种新度量标准 ,用于量化视觉编码器先验知识对 MLLM 性能的影响。我们的分析揭示了先验知识与 MLLM 性能之间的正相关性。此外,我们发现仅使用端到端视觉问答(VQA)数据进行的领域特定微调对于视觉先验知识较低的实体仍不够。为此,我们提出 VisPRE(Vision Prior Remediation),即一种两阶段训练框架,显式地在视觉编码器层面融合先验知识。实验结果表明,增强视觉编码器的先验知识可显著提升 MLLMs 的视觉理解能力,为提升性能(尤其是针对不寻常视觉实体)提供了一种新颖且高效的方法。
引用
@article{arxiv.2503.18034,
title = {Expanding the Boundaries of Vision Prior Knowledge in Multi-modal Large Language Models},
author = {Qiao Liang and Yanjiang Liu and Weixiang Zhou and Ben He and Yaojie Lu and Hongyu Lin and Jia Zheng and Xianpei Han and Le Sun and Yingfei Sun},
journal= {arXiv preprint arXiv:2503.18034},
year = {2025}
}