中文

针对多模态大语言模型视觉表征退化的预测性正则化

计算机视觉与模式识别 2026-03-24 v1 机器学习

摘要

尽管多模态大语言模型(MLLMs)在视觉语言任务中表现出色,但其语言驱动训练对内部视觉基础 competence 的成本尚不明了。本文我们进行详细的诊断分析,揭示一种普遍存在的问题:MLLMs 中的视觉表征退化。具体而言,我们发现与初始视觉特征相比,LLM 中层的视觉表征在全局功能和 patch 结构方面均呈现退化。我们将此现象归因于语言驱动的单一文本生成目标导致的视觉牺牲,即模型为优化答案生成而妥协其视觉保真度。我们认为,健全的 MLLM 需要强大的跨模态推理和核心视觉 competence,提出预测性正则化(PRe)以迫使退化的中间特征预测初始视觉特征,从而维持 MLLM 内部表征的固有视觉属性。大量实验确认,缓解此视觉退化有效提升视觉语言性能,凸显在 MLLMs 中培育健壮内部视觉表征的重要性,以实现全面多模态理解。

关键词

引用

@article{arxiv.2603.20808,
  title  = {Predictive Regularization Against Visual Representation Degradation in Multimodal Large Language Models},
  author = {Enguang Wang and Qiang Wang and Yuanchen Wu and Ke Yan and Xinbin Yuan and Shouhong Ding and Xialei Liu and Ming-Ming Cheng},
  journal= {arXiv preprint arXiv:2603.20808},
  year   = {2026}
}

备注

Accepted at CVPR 2026