中文

QMAVIS:基于大多模态模型融合的长视频-音频理解

人工智能 2026-01-13 v1 多媒体

摘要

大型多模态模型(LMM)用于视频-音频理解的传统评估仅限于几分钟的短视频。本文介绍 QMAVIS (Q Team-Multimodal Audio Video Intelligent Sensemaking),一个通过 LMM、大语言模型和语音识别模型的晚期融合构建的长视频-音频理解管道。QMAVIS 解决了长篇视频分析的空白,尤其是针对从几分钟到超过一小时的长视频,为 sensemaking、视频内容分析、具身 AI 等应用开辟了新潜力。使用 QMAVIS 进行的量化实验显示,相较于 VideoLlaMA2 和 InternVL2 等最先进的视频-音频 LMM,在包含字幕的数据集 VideoMME 上提升了 38.75%。在 PerceptionTest 和 EgoSchema 等其他具有挑战性的视频理解数据集上,提升幅度达到 2%,表明性能具竞争力。定性实验也表明,QMAVIS 能够在理解长视频音频内容的同时,提炼出不同场景的细微差别,并把握整体叙事。我们还对融合管道的各个组件影响进行了消融研究。

关键词

引用

@article{arxiv.2601.06573,
  title  = {QMAVIS: Long Video-Audio Understanding using Fusion of Large Multimodal Models},
  author = {Zixing Lin and Jiale Wang and Gee Wah Ng and Lee Onn Mak and Chan Zhi Yang Jeriel and Jun Yang Lee and Yaohao Li},
  journal= {arXiv preprint arXiv:2601.06573},
  year   = {2026}
}