中文

Video-MMMU:评估从多学科专业视频中获取知识的能力

计算机视觉与模式识别 2025-01-24 v1 计算与语言

摘要

人类通过三个认知阶段获取知识:感知信息、理解知识以及调整知识以解决新问题。视频作为这一学习过程的有效媒介,促进了这些认知阶段的递进。然而,现有的视频基准未能系统地评估大型多模态模型 (LMMs) 的知识获取能力。为了弥补这一差距,我们引入了 Video-MMMU,这是一个多模态、多学科的基准,旨在评估 LMMs 从视频中获取和利用知识的能力。Video-MMMU 包含一个精心策划的集合,涵盖 6 个学科的 300 个专家级视频和 900 个人工标注问题,通过与认知阶段对齐的问答对来评估知识获取:感知、理解和调整。提出的知识增益度量指标 {\Delta}knowledge 量化了观看视频后性能的提升。对 LMMs 的评估显示,随着认知需求的增加,性能急剧下降,并突显了人类与模型在知识获取方面的显著差距,这强调了需要方法来增强 LMMs 从视频中学习和调整的能力。

关键词

引用

@article{arxiv.2501.13826,
  title  = {Video-MMMU: Evaluating Knowledge Acquisition from Multi-Discipline Professional Videos},
  author = {Kairui Hu and Penghao Wu and Fanyi Pu and Wang Xiao and Yuanhan Zhang and Xiang Yue and Bo Li and Ziwei Liu},
  journal= {arXiv preprint arXiv:2501.13826},
  year   = {2025}
}