中文

MMVU:衡量专家水平多学科视频理解

计算机视觉与模式识别 2025-01-22 v1 人工智能 计算与语言

摘要

我们引入 MMVU,这是一个用于评估视频理解基础模型的全面型、专家水平、跨学科基准。MMVU 包含 3000 个由专家标注的问题,覆盖 27 个学科,跨越四个核心学科:科学、医疗、人文与社会科学以及工程。与先前基准相比,MMVU 具有三个关键突破。首先,它挑战模型应用领域特定知识并进行专家水平推理以分析专业领域视频,超越当前视频基准中通常衡量的基础视觉感知。其次,每个样例均由人类专家从零开始标注。我们实施严格的数据质量控制,以确保数据集的高质量。最后,每个样例都充满了专家标注的推理依据和相关领域知识,促进深入分析。我们在 MMVU 上对 32 个前沿多模态基础模型进行了广泛评估。最新的具备 System-2 能力的模型 o1 和 Gemini 2.0 Flash Thinking 在所测试模型中取得了最高性能。然而,它们仍不足以匹配人类专家水平。通过深入的错误分析和案例研究,我们为未来在专家水平、知识密集型视频理解方面的 specialized 领域提供了可操作的见解。

关键词

引用

@article{arxiv.2501.12380,
  title  = {MMVU: Measuring Expert-Level Multi-Discipline Video Understanding},
  author = {Yilun Zhao and Lujing Xie and Haowei Zhang and Guo Gan and Yitao Long and Zhiyuan Hu and Tongyan Hu and Weiyuan Chen and Chuhan Li and Junyang Song and Zhijian Xu and Chengye Wang and Weifeng Pan and Ziyao Shangguan and Xiangru Tang and Zhenwen Liang and Yixin Liu and Chen Zhao and Arman Cohan},
  journal= {arXiv preprint arXiv:2501.12380},
  year   = {2025}
}