HLV-1K:面向特定时间时长视频理解的大规模小时级视频基准
计算机视觉与模式识别
2025-05-14 v3 人工智能
摘要
由于许多有前景的现实世界应用,多模态大语言模型已成为深度视觉理解中的热门话题。然而,跨度超过一小时并包含数万个视觉帧的小时级视频理解仍处于探索不足的状态,原因在于:1)具有挑战性的长视频分析,2)低效的大模型方法,以及 3)缺乏大规模基准数据集。其中,在本文中,我们专注于构建一个大规模的小时级长视频基准 HLV-1K,旨在评估长视频理解模型。HLV-1K 包含 1009 个小时级视频,具有 14,847 个高质量问答(QA)和多选题问答(MCQA)对,带有时间感知查询和多样化标注,涵盖帧级、事件内级、跨事件级和长期推理任务。我们使用现有的 state-of-the-art 方法评估了我们的基准,并证明了其在不同层次和不同任务中测试深度长视频理解能力的价值。这包括在粒度级别促进未来的长视频理解任务,例如长直播视频、会议录像和电影的深度理解。
引用
@article{arxiv.2501.01645,
title = {HLV-1K: A Large-scale Hour-Long Video Benchmark for Time-Specific Long Video Understanding},
author = {Heqing Zou and Tianze Luo and Guiyang Xie and Victor Xiao Jie Zhang and Fengmao Lv and Guangcong Wang and Junyang Chen and Zhuochen Wang and Hansheng Zhang and Huaijian Zhang},
journal= {arXiv preprint arXiv:2501.01645},
year = {2025}
}
备注
Accepted to ICME 2025