中文

解放小时级视频训练:长视频语言理解的关键突破

计算机视觉与模式识别 2025-12-03 v2 计算与语言

摘要

近期的长篇视频语言理解基准测试推动了视频大型多模态模型(Video-LMM)的进步。然而,稀缺的高质量长视频标注数据,使得针对小时级视频的Video-LMM训练仍未得到充分探索。为弥合这一差距,我们提出VideoMarathon——一个大规模小时级视频指令跟随数据集。该数据集包含约9700小时来自多领域的长视频(每段3至60分钟),具体包含330万组高质量问答对,涵盖六大核心主题:时间性、空间性、物体、动作、场景与事件。与现有视频指令数据集相比,VideoMarathon显著扩展了训练视频时长至1小时,并支持22种需要短期与长期视频理解的多样化任务。基于VideoMarathon,我们提出Hour-LLaVA——一个强大且高效的Video-LMM,通过记忆增强模块实现对小时级视频的语言建模,该模块能自适应整合问题相关性和时空信息丰富语义。实验表明,Hour-LLaVA在多个代表性长视频语言基准测试中取得最佳性能,证明了VideoMarathon数据集的高质量及Hour-LLaVA模型的卓越性。

关键词

引用

@article{arxiv.2506.05332,
  title  = {Unleashing Hour-Scale Video Training for Long Video-Language Understanding},
  author = {Jingyang Lin and Jialian Wu and Ximeng Sun and Ze Wang and Jiang Liu and Yusheng Su and Xiaodong Yu and Hao Chen and Jiebo Luo and Zicheng Liu and Emad Barsoum},
  journal= {arXiv preprint arXiv:2506.05332},
  year   = {2025}
}

备注

NeurIPS 2025, Project page: https://videomarathon.github.io/