中文

并非所有模态都等价:面向多模态视频的指令感知门控

计算机视觉与模式识别 2026-05-27 v1

摘要

预训练的视频大语言模型在视觉推理方面表现优异,但在面对伴随音频、深度图或稠密时间证据等辅助流时却力不从众。在此情境下,统一融合会导致模态干扰,使不相关通道干扰模型。为此,我们提出一种统一的多模态视频理解框架,命名为UniMVU,通过两个层次的动态门控在视频、音频、深度图或其他任何模态输入之间进行指令感知融合:内模态门控强调每个模态内部的显著区域,而模态级别门控对整个流进行加权;两者都以文本指令为条件,自适应平衡模态重要性。我们的UniMVU将跨模态自注意力与指令驱动的内模态门控模块和带有控制token的模态级别门控模块相结合;对于时间对齐的流,我们进一步采用快速到慢速的融合方案以减少冗余。在六个基准(AVQA、AVSD、Music-AVQA、ScanQA、SQA3D和MVBench)上,我们的UniMVU相对于静态融合基线实现了持续的提升,CIDEr指标提升幅度可达13.5。进一步的分析表明,门控机制与人类可解释的模态相关性相吻合,消融实验显示内模态门控和模态级别门控的贡献。我们的UniMVU为无需手工设计融合规则的指令感知多模态视频理解提供了简单且统一的方案,能够扩展到多样化的模态。

关键词

引用

@article{arxiv.2605.26232,
  title  = {Not All Modalities Are Equal: Instruction-Aware Gating for Multimodal Videos},
  author = {Bonan Ding and Umair Nawaz and Ufaq Khan and Abdelrahman M. Shaker and Muhammad Haris Khan and Jiale Cao and Jin Xie and Fahad Shahbaz Khan},
  journal= {arXiv preprint arXiv:2605.26232},
  year   = {2026}
}

备注

19 pages, 8 figures, 7 tables, preprint