OVO-Bench:你的视频大语言模型离真实世界在线视频理解还有多远?
计算机视觉与模式识别
2025-03-28 v2 人工智能
摘要
时间感知能力——即根据问题提出的时间戳进行动态推理的能力——是在线视频大语言模型与离线视频大语言模型的关键区别。离线模型依赖完整视频进行静态的事后分析,而在线模型则增量式地处理视频流,并根据问题提出的时间戳动态调整其响应。尽管时间感知能力至关重要,但现有基准测试尚未对其进行充分评估。为填补这一空白,我们提出了OVO-Bench(在线视频基准测试),这是一个新颖的视频基准测试,强调时间戳对于高级在线视频理解能力基准测试的重要性。OVO-Bench在三种不同场景下评估视频大语言模型推理和响应特定时间戳事件的能力:(1)回溯:追溯过去事件以回答问题;(2)实时理解:理解并响应当前时间戳正在发生的事件;(3)前向主动响应:延迟响应,直到获得足够的未来信息以准确回答问题。OVO-Bench包含12个任务,涵盖644个独特视频和约2800个人工细粒度元注释,并带有精确时间戳。我们结合了自动生成流程和人工筛选。利用这些高质量样本,我们进一步开发了一个评估流程,沿视频时间线系统性地查询视频大语言模型。对九个视频大语言模型的评估表明,尽管在传统基准测试上取得了进展,但当前模型在在线视频理解方面仍存在困难,与人类代理相比存在显著差距。我们希望OVO-Bench能推动视频大语言模型的发展,并激发未来在线视频推理的研究。我们的基准测试和代码可在https://github.com/JoeLeelyf/OVO-Bench获取。
引用
@article{arxiv.2501.05510,
title = {OVO-Bench: How Far is Your Video-LLMs from Real-World Online Video Understanding?},
author = {Yifei Li and Junbo Niu and Ziyang Miao and Chunjiang Ge and Yuanhang Zhou and Qihao He and Xiaoyi Dong and Haodong Duan and Shuangrui Ding and Rui Qian and Pan Zhang and Yuhang Zang and Yuhang Cao and Conghui He and Jiaqi Wang},
journal= {arXiv preprint arXiv:2501.05510},
year = {2025}
}
备注
CVPR 2025