中文

MMOU:面向长而复杂真实世界视频的大规模多任务全模态理解与推理基准

计算与语言 2026-03-17 v1 计算机视觉与模式识别

摘要

多模态大语言模型(MLLM)在孤立评估中已在视觉和音频理解方面表现出强大性能。然而,它们在长而复杂的视频中联合推理全模态(视觉、音频和文本)信号的能力仍 largely 未被探索。我们引入了MMOU,一个新的基准,旨在系统评估在这些具有挑战性的真实世界条件下的多模态理解和推理。MMOU包含15,000个精心策划的问题,配对9,038个网络收集的视频,长度各异,涵盖多个领域,并展现出丰富、紧密耦合的音视频内容。该基准涵盖13个基本技能类别,所有类别都需要跨模态和时间整合证据。所有问题均由专业标注人员经过多轮手动标注,确保高质量和推理保真度。我们在MMOU上评估了20多个最先进的开源和专有多模态模型。结果暴露了显著的性能差距:最佳闭源模型仅达到64.2%的准确率,而最强的开源模型仅达到46.8%。我们的结果突显了长形式全模态理解的挑战,揭示当前模型即使在长视频中也经常无法应用基本技能。通过详细分析,我们进一步识别了系统性失败模式,并提供了关于当前模型在何处以及为何崩溃的见解。

关键词

引用

@article{arxiv.2603.14145,
  title  = {MMOU: A Massive Multi-Task Omni Understanding and Reasoning Benchmark for Long and Complex Real-World Videos},
  author = {Arushi Goel and Sreyan Ghosh and Vatsal Agarwal and Nishit Anand and Kaousheik Jayakumar and Lasha Koroshinadze and Yao Xu and Katie Lyons and James Case and Karan Sapra and Kevin J. Shih and Siddharth Gururani and Abhinav Shrivastava and Ramani Duraiswami and Dinesh Manocha and Andrew Tao and Bryan Catanzaro and Mohammad Shoeybi and Wei Ping},
  journal= {arXiv preprint arXiv:2603.14145},
  year   = {2026}
}

备注

Project Page: https://huggingface.co/datasets/nvidia/MMOU