中文

VISTA:通过跨模态互信息最大化提升视觉-文本对齐

计算机视觉与模式识别 2025-05-20 v2

摘要

当前的多模态大语言模型(MLLMs)面临着关键性模态对齐挑战,常常对文本信息表现出偏倚,而牺牲其他模态如视觉的信息。本文对广泛使用的交叉熵损失进行系统性信息论分析,揭示其隐式对齐目标。我们的理论调查表明,这种隐式目标具有内在局限性,导致随文本序列长度增加而导致跨模态对齐退化,从而阻碍有效的多模态信息融合。为克服这些缺陷,我们提出了一种受理论见解指导的视觉-文本对齐方法(Vision-Text Alignment, VISTA)。VISTA引入了旨在最大化跨模态互信息的显式对齐目标,以防止视觉对齐的退化。值得注意的是,VISTA无需任何额外的可训练模块或额外训练数据,即可提升现有MLLMs的视觉理解能力,既高效又实用。我们的方法在包括 VQAv2、MMStar 和 MME 在内的超过十几个基准数据集上显著优于基线模型,为 MLLM 模态对齐研究开辟了新的方向。

关键词

引用

@article{arxiv.2505.10917,
  title  = {VISTA: Enhancing Vision-Text Alignment in MLLMs via Cross-Modal Mutual Information Maximization},
  author = {Mingxiao Li and Na Su and Fang Qu and Zhizhou Zhong and Ziyang Chen and Yuan Li and Zhaopeng Tu and Xiaolong Li},
  journal= {arXiv preprint arXiv:2505.10917},
  year   = {2025}
}