MLVU:多任务长视频理解基准
计算机视觉与模式识别
2025-01-03 v3 人工智能
计算与语言
摘要
长视频理解(LVU)性能的评估是一个重要但具有挑战性的研究问题。尽管已有努力,但现有的视频理解基准受到几个问题的严重限制,特别是视频长度不足、视频类型和评估任务缺乏多样性,以及不适合评估LVU性能。为解决上述问题,我们提出了一个新的基准MLVU(多任务长视频理解基准),用于全面深入地评估LVU。MLVU具有以下关键价值:1)视频长度的显著且灵活的扩展,使基准能够评估各种时长下的LVU性能。2)包含多种视频类型,例如电影、监控视频、自我中心视频、卡通、游戏视频等,反映了模型在不同场景下的LVU性能。3)开发多样化的评估任务,能够全面检查多模态大语言模型(MLLM)在长视频理解中的关键能力。对23个最新MLLM的实证研究表明,当今技术仍有很大的改进空间,因为所有现有方法在大多数评估任务上都表现困难,并且在处理更长视频时性能严重下降。此外,研究表明上下文长度、图像理解能力和LLM骨干的选择等因素可能在未来的进展中发挥关键作用。我们期望MLVU通过提供对MLLM的全面深入分析来推动长视频理解的研究。
引用
@article{arxiv.2406.04264,
title = {MLVU: Benchmarking Multi-task Long Video Understanding},
author = {Junjie Zhou and Yan Shu and Bo Zhao and Boya Wu and Zhengyang Liang and Shitao Xiao and Minghao Qin and Xi Yang and Yongping Xiong and Bo Zhang and Tiejun Huang and Zheng Liu},
journal= {arXiv preprint arXiv:2406.04264},
year = {2025}
}