信息路由器用于缓解视觉语言模型中的模态主导问题
计算机视觉与模式识别
2026-04-20 v1 机器学习
摘要
视觉语言模型(Vision Language models, VLMs)在广泛的基准测试中表现出强大的性能,但常常 suffer from 模态主导(modality dominance)问题,即预测过度依赖单一模态。以往方法主要通过引导模型注意力分配来解决此问题,隐含假设所有模态都提供充足信息。然而,注意力仅决定模型关注的地方,无法丰富缺失或模糊的信息。在现实世界中,输入模态在信息密度和信噪比上常有差异。在这种情况下,仅调整模型的注意力并不能解决根本性信息不足的问题。本文提出了 \textsc{MoIR}:\textit{多模态信息路由器}(Multi-modal Information Router),一种在融合前显式降低信息差异的级信息融合方法。\textsc{MoIR} 识别信息较少的标记,并从更强的模态路由补充信息,构建信息密集型标记表征,供大语言模型处理。通过修改信息可用性,\textsc{MoIR} 即使在单一模态退化时也能实现可靠的模态主导转移。我们在三个广泛使用的多模态基准上评估了 \textsc{MoIR},并使用多个模型 backbone。实验结果显示,\textsc{MoIR} 在模态贡献更平衡、鲁棒性和下游性能方面 consistently demonstrate better results,尤其在模态退化情况下效果更为显著。这些发现表明,显式修改跨模态信息是缓解多模态推理模型中模态主导问题的有效且互补策略。
引用
@article{arxiv.2604.16264,
title = {Information Router for Mitigating Modality Dominance in Vision-Language Models},
author = {Seulgi Kim and Mohit Prabhushankar and Ghassan AlRegib},
journal= {arXiv preprint arXiv:2604.16264},
year = {2026}
}