H2VU-Benchmark:面向层次化整体视频理解的综合基准
计算机视觉与模式识别
2025-05-28 v2 人工智能
摘要
随着多模态模型的快速发展,对评估视频理解能力的需求日益增加。然而,现有的视频理解基准在覆盖范围、任务多样性和场景适应性方面存在显著局限,这些局限阻碍了对模型综合视频理解能力的准确评估。为此,我们提出了一种层次化整体视频理解(H2VU)基准,旨在评估通用视频和在线流媒体视频的理解能力。该基准具有三个关键特征:扩展的视频时长:涵盖从简短的 3 秒片段到综合的 1.5 小时录像,填补当前基准之间的时序差距。全面的评估任务:除传统的感知和推理任务外,我们引入了反常识理解和轨迹状态跟踪模块,这些 addition 测试了模型在仅凭先验知识之外的深层理解能力。丰富的视频数据:为跟上当前 AI 智能体的快速发展,我们扩充了第一人称流媒体视频数据集。这一扩展允许探索多模态模型在从第一人称视角理解流媒体视频方面的性能。H2VU 的广泛结果揭示,现有的多模态大语言模型(MLLMs)在我们新提出的评估任务方面仍具显著提升潜力。我们期望 H2VU 将促进视频理解研究的进展,通过提供对 MLLMs 全面深入分析,推动该领域的发展。
引用
@article{arxiv.2503.24008,
title = {H2VU-Benchmark: A Comprehensive Benchmark for Hierarchical Holistic Video Understanding},
author = {Qi Wu and Quanlong Zheng and Yanhao Zhang and Junlin Xie and Jinguo Luo and Kuo Wang and Peng Liu and Qingsong Xie and Ru Zhen and Zhenyu Yang and Haonan Lu},
journal= {arXiv preprint arXiv:2503.24008},
year = {2025}
}