中文

Vision Inference Former:在多模态大语言模型中维持视觉一致性

计算机视觉与模式识别 2026-05-19 v1 人工智能

摘要

近年来,多模态大语言模型(MLLMs)取得了显著进展,主要归功于视觉与文本信息的有效整合范式。主流的基于连接器的范式将视觉特征投影到文本序列中,从而在生成架构内实现统一的多模态对齐与推理。然而,我们的实验揭示了两个关键局限:(1)尽管视觉信息在 MLLMs 中作为核心证据模态,但其被等同于文本词元处理,削弱了视觉模态的独特贡献;(2)随着生成长度的增加,特别是在有限的上下文窗口内,模型对视觉信息的依赖逐渐减弱,导致视觉-语言对齐退化,生成内容与视觉语义之间的一致性降低。为了应对这些挑战,我们提出了 Vision Inference Former(VIF),这是一个轻量级的架构模块,在纯视觉表示与模型输出空间之间建立直接桥梁。具体而言,VIF 在推理过程的解码阶段持续注入视觉语义,确保模型在生成过程中始终立足于视觉内容。我们在涵盖通用推理、OCR、表格理解、以视觉为中心的评估以及幻觉的 14 个基准任务上进行了实验。实验结果表明,VIF 在引入极少额外开销的同时,能够在不同架构上持续提升模型性能。本工作的代码可在 https://github.com/Dong-Xinpeng/VIF 获取。

关键词

引用

@article{arxiv.2605.18160,
  title  = {Vision Inference Former: Sustaining Visual Consistency in Multimodal Large Language Models},
  author = {Xinpeng Dong and Min Zhang and Kairong Han and Xu Tan and Fei Wu and Kun Kuang},
  journal= {arXiv preprint arXiv:2605.18160},
  year   = {2026}
}