中文

Video-MME:首个面向视频分析的多模态大语言模型全面评估基准

计算机视觉与模式识别 2025-06-02 v3 计算与语言

摘要

在追求通用人工智能的过程中,多模态大语言模型(MLLMs)已成为近期进展的焦点。然而,当前的研究重点仍主要集中于其在静态图像理解方面的能力。MLLMs在处理序列视觉数据方面的潜力尚未得到充分探索,这凸显了缺乏对其性能进行全面、高质量评估的问题。本文介绍了Video-MME,这是首个面向视频分析的全频谱多模态评估基准。我们的工作通过四个关键特征与现有基准区分开来:1)视频类型的多样性,涵盖6个主要视觉领域和30个子领域,以确保广泛的场景泛化能力;2)时间维度的时长,包含短、中、长三种时长的视频,范围从11秒到1小时,以捕捉稳健的上下文动态;3)数据模态的广度,除了视频帧外,还集成了字幕和音频等多模态输入,以揭示MLLMs的全方位能力;4)标注质量,采用专家标注员的严格人工标注,以促进精确可靠的模型评估。我们通过反复观看所有视频内容,手动挑选并标注了900个视频,总时长254小时,生成了2700个问答对。利用Video-MME,我们广泛评估了多种最先进的MLLMs,包括GPT-4系列、Gemini 1.5 Pro,以及开源图像模型(如InternVL-Chat-V1.5)和视频模型(如LLaVA-NeXT-Video)。实验表明,Gemini 1.5 Pro是性能最佳的商业模型,显著优于开源模型。我们的数据集及这些发现强调了在处理更长序列和多模态数据方面需要进一步改进。项目页面:https://video-mme.github.io

关键词

引用

@article{arxiv.2405.21075,
  title  = {Video-MME: The First-Ever Comprehensive Evaluation Benchmark of Multi-modal LLMs in Video Analysis},
  author = {Chaoyou Fu and Yuhan Dai and Yongdong Luo and Lei Li and Shuhuai Ren and Renrui Zhang and Zihan Wang and Chenyu Zhou and Yunhang Shen and Mengdan Zhang and Peixian Chen and Yanwei Li and Shaohui Lin and Sirui Zhao and Ke Li and Tong Xu and Xiawu Zheng and Enhong Chen and Caifeng Shan and Ran He and Xing Sun},
  journal= {arXiv preprint arXiv:2405.21075},
  year   = {2025}
}

备注

Project Page: https://video-mme.github.io