中文

进度感知视频帧描述

计算机视觉与模式识别 2025-03-27 v2

摘要

虽然图像描述为单个图像提供孤立的描述,视频描述则为整个视频剪辑提供单一叙事,但我们的工作探索了一个重要的中间地带:帧级别的进度感知视频描述。这个新任务旨在生成具有精细时序细节的描述,不仅准确描述每个帧,还捕捉整个视频序列中动作的细微进展。尽管现有领先的视觉语言模型具有强大的能力,但它们往往难以辨别帧级差异的细微差别。为此,我们提出了ProgressCaptioner,一种旨在捕捉动作序列中细粒度时序动态的描述模型。同时,我们开发了FrameCap数据集以支持训练,以及FrameCapEval基准以评估描述质量。结果表明,ProgressCaptioner显著优于领先的描述模型,产生精确的描述,准确捕捉动作进展,为时序精度在视频描述中树立了新标准。最后,我们展示了该方法的实际应用,具体是在辅助关键帧选择和推进视频理解方面,凸显了其广泛的实用性。

关键词

引用

@article{arxiv.2412.02071,
  title  = {Progress-Aware Video Frame Captioning},
  author = {Zihui Xue and Joungbin An and Xitong Yang and Kristen Grauman},
  journal= {arXiv preprint arXiv:2412.02071},
  year   = {2025}
}

备注

Accepted by CVPR 2025, Project website: https://vision.cs.utexas.edu/projects/ProgressCaptioner/