LvBench:面向通用多模态问答的长视频理解基准
计算机视觉与模式识别
2025-09-03 v2
摘要
尽管近期取得了显著进展,现有的长视频问答数据集仍未能满足真正长视频理解的标准。这主要源于使用短视频来策划问题,并依赖有限长度的子片段作为回答问题的线索。同时,以往数据集对问题类型和模态的关注有限。为此,我们引入了 LvBench,一个面向通用多模态问答的长视频理解基准。我们的 LvBench 通过三个关键特性从现有长视频问答数据集中脱颖而出:1) 扩展的时间跨度:我们考虑从 70 秒到 4 小时的视频,涵盖单场景、多场景和全场景上下文。这种设计兼顾了视频和线索长度,捕捉了多样的上下文动态。2) 多样化的问题类型与模态:LvBench 引入了六种不同的问题类型,评估各种感知和认知能力,同时利用视频帧和字幕。3) 高质量的标注:我们采用人工标注者进行严格的标注。我们的数据集包含 20,061 个问答对,源自 100 部精心挑选的不同类型电影,由多人协作标注。涉及多种基线的分析揭示了一个一致的趋势:当视频和线索长度增加时,所有现有方法的性能都显著恶化。我们期望 LvBench 能成为未来长视频理解工作的宝贵资源。
引用
@article{arxiv.2312.04817,
title = {LvBench: A Benchmark for Long-form Video Understanding with Versatile Multi-modal Question Answering},
author = {Hongjie Zhang and Lu Dong and Yi Liu and Yifei Huang and Yali Wang and Limin Wang and Yu Qiao},
journal= {arXiv preprint arXiv:2312.04817},
year = {2025}
}