中文

未被看见的偏差:Pre-Norm MLLM架构中的范数不匹配导致视觉信息损失

计算机视觉与模式识别 2025-12-10 v1

摘要

多模态大语言模型( MLLM)将预训练视觉编码器与语言模型耦合,已展现出卓越的能力。然而,其依赖普遍采用的Pre-Norm架构,引入了一个细微却关键的缺陷:视觉标记(高范数)与文本标记(低范数)之间的严重范数不平衡。在本文中,我们提出正式的理论分析,表明这种不平衡并非静态问题,而是引发“非对称更新动力学”,导致高范数视觉标记表现出“表征惯性”,其语义转换速度远慢于文本标记。这从根本上损害了有效的跨模态特征融合。我们的实证验证在广泛的主流MLLM上确认,这一理论动力学——范数不平衡的持久性及其导致的非对称更新率——是普遍现象。基于这一洞察,我们提出一种极其简单却高效的解决方案:在视觉投影器后插入一个已精确初始化的LayerNorm层,以强制范数对齐。实验表明,在LLaVA-1.5架构上实施此干预,不仅在广泛的多模态基准测试中显著提升性能,而且在文本-only评估(如MMLU)中亦表现出显著 gains,表明解决架构失衡可构建更具整体能力的模型。

关键词

引用

@article{arxiv.2512.08374,
  title  = {The Unseen Bias: How Norm Discrepancy in Pre-Norm MLLMs Leads to Visual Information Loss},
  author = {Bozhou Li and Xinda Xue and Sihan Yang and Yang Shi and Xinlong Chen and Yushuo Guan and Yuanxing Zhang and Wentao Zhang},
  journal= {arXiv preprint arXiv:2512.08374},
  year   = {2025}
}