释放多模态大语言模型内在视觉表征能力
计算机视觉与模式识别
2025-12-09 v1 人工智能
摘要
多模态大语言模型(MLLM)在多模态任务中展现出惊人的能力。尽管性能卓越,MLLM仍存在模态不平衡问题,即在更深的层次上,视觉信息常被低于文本表示所 underutilize,导致视觉性能下降或出现幻觉。这一问题源于训练时主要依赖下一个文本标记的预测,未能提供直接的视觉监督信号,导致视觉表征在各层中逐渐同质化。为此,我们提出潜在视觉重建(LaVer),一种新的训练框架,通过在LLM联合潜在语义空间中的掩码图像建模,帮助MLLM学习更具辨识力的视觉表征。我们的方法为MLLM提供了直接的视觉激活,显示出更高的视觉注意力分配,表明视觉信息的利用率提高。广泛的实验表明,我们的方法在各种基准测试中均显示出优势,尤其是那些需要密集视觉能力的场景。LaVer的代码可在https://github.com/Fir-lat/LaVer获取。
引用
@article{arxiv.2512.06281,
title = {Unleashing the Intrinsic Visual Representation Capability of Multimodal Large Language Models},
author = {Hengzhuang Li and Xinsong Zhang and Qiming Peng and Bin Luo and Han Hu and Dengyang Jiang and Han-Jia Ye and Teng Zhang and Hai Jin},
journal= {arXiv preprint arXiv:2512.06281},
year = {2025}
}