中文

观看与聆听:基于多模态大语言模型理解音视频-语音时刻

计算与语言 2026-02-03 v3

摘要

人类自然地通过整合视觉和听觉线索来理解视频中的时刻。例如,定位视频中的场景,如"一位科学家热情地谈论野生动物保护,伴随戏剧性的管弦乐演奏,观众点头鼓掌",需要同时处理视觉、音频和语音信号。然而,现有模型往往难以有效融合和解释音频信息,限制了其全面理解视频时序的能力。为解决这一问题,我们提出了 TriSense,一个专为通过整合视觉、音频和语音模态实现视频时序全面理解而设计的三模态大语言模型。TriSense 的核心是一个基于查询的连接器,它根据输入查询自适应地重新加权各模态的贡献,从而在模态丢失的情况下实现鲁棒性能,并允许灵活组合可用输入。为支持 TriSense 的多模态能力,我们引入了 TriSense-2M,一个包含超过 200 万个经过精心筛选样本的高质量数据集,通过微调大语言模型驱动的自动化流水线生成。TriSense-2M 包含长视频和多样化的模态组合,有助于广泛泛化。在多个基准测试上的广泛实验证明了 TriSense 的有效性及其推进多模态视频分析的潜力。代码和数据集将公开发布。

关键词

引用

@article{arxiv.2505.18110,
  title  = {Watch and Listen: Understanding Audio-Visual-Speech Moments with Multimodal LLM},
  author = {Zinuo Li and Xian Zhang and Yongxin Guo and Mohammed Bennamoun and Farid Boussaid and Girish Dwivedi and Luqi Gong and Qiuhong Ke},
  journal= {arXiv preprint arXiv:2505.18110},
  year   = {2026}
}

备注

Accepted by NeurIPS 2025