Video-MMLU:大型多学科讲座理解基准
计算机视觉与模式识别
2025-05-06 v2 人工智能
摘要
近期语言多模态模型 (LMM) 在视频上的发展已展示出理解视频内容的潜力,但理解多学科讲座的任务仍 largely 未被探索。我们引入Video-MMLU,一个旨在评估 LMM 理解 Multi-Discipline Lectures 能力的大型基准。我们评估了90多个开源和专有模型,参数规模从0.5B到40B。我们的结果突显了当前模型在应对这些讲座所呈现的认知挑战方面的局限性,尤其是在需要感知与推理的任务中。此外,我们探讨了视觉 token 数量和大型语言模型对性能的影响,为多模态感知与推理在讲座理解中的相互作用提供了见解。
关键词
引用
@article{arxiv.2504.14693,
title = {Video-MMLU: A Massive Multi-Discipline Lecture Understanding Benchmark},
author = {Enxin Song and Wenhao Chai and Weili Xu and Jianwen Xie and Yuxuan Liu and Gaoang Wang},
journal= {arXiv preprint arXiv:2504.14693},
year = {2025}
}
备注
Code, docs, and benchmark are all avaliable at https://enxinsong.com/Video-MMLU-web/