中文

LVSum: 基于时间戳的长视频摘要基准

计算机视觉与模式识别 2026-04-14 v1 人工智能 机器学习

摘要

长视频摘要面临当前多模态大语言模型(MLLMs)的诸多挑战,尤其是在维持长时间段内的时序保真性以及生成在语义和时序上都具 grounding 的摘要方面。本文提出LVSum,一个以人类标注为导向的基准,专为评估具有细粒度时序对齐的长视频摘要而设计。LVSum涵盖13个领域的多样长视频,每个视频配有包含精确时序引用的人类生成摘要。我们对 proprietary 和开源 MLLMs 在LVSum上的全面评估,使用新引入的基于LLM的指标衡量内容相关性和模态连贯性,以及标准评估指标。我们的实验揭示了现有 MLLMs在时序理解方面的系统性缺口,并提供了洞见,为在长视频摘要中推进时序推理奠定了新基础。

关键词

引用

@article{arxiv.2604.10024,
  title  = {LVSum: A Benchmark for Timestamp-Aware Long Video Summarization},
  author = {Alkesh Patel and Melis Ozyildirim and Ying-Chang Cheng and Ganesh Nagarajan},
  journal= {arXiv preprint arXiv:2604.10024},
  year   = {2026}
}

备注

25 pages, 5 tables, 3 figures