中文

H2VU-Benchmark:用于层次化整体视频理解的综合基准

机器学习 2025-08-07 v3 人工智能

摘要

随着多模态模型的快速发展,对评估视频理解能力的需求日益增加。然而,现有视频理解基准在覆盖范围、任务多样性和场景适应性方面存在显著局限,这些局限阻碍了对模型综合视频理解能力的准确评估。为此,我们提出一种层次化和整体视频理解(H2VU)基准,旨在评估常规视频和在线流式视频理解。该基准具有三个关键特征:扩展的视频时长:涵盖从3秒短片到1.5小时综合录像,弥合当前基准在时间上的差距。全面的评估任务:除传统的感知和推理任务外,我们引入反常识理解和轨迹状态跟踪模块,这些 addition 测试模型在深层理解方面的能力,超越仅依赖先验知识。丰富的视频数据:为跟进当前AI智能体的快速演进,我们扩充了第一人称流式视频数据集。这一扩展允许探索多模态模型在从第一人称视角理解流式视频方面的性能。H2VU基准的结果揭示,现有多模态大语言模型(MLLM)在我们新提出的评估任务方面仍有显著提升空间。我们期望H2VU能够通过提供对MLLM进行全面和深入分析,推动视频理解研究的进步。

关键词

引用

@article{arxiv.2503.24007,
  title  = {CITRAS: Covariate-Informed Transformer for Time Series Forecasting},
  author = {Yosuke Yamaguchi and Issei Suemitsu and Wenpeng Wei},
  journal= {arXiv preprint arXiv:2503.24007},
  year   = {2025}
}

备注

Submission under review