进度感知视频帧描述
计算机视觉与模式识别
2025-03-27 v2
摘要
虽然图像描述为单个图像提供孤立的描述,视频描述则为整个视频剪辑提供单一叙事,但我们的工作探索了一个重要的中间地带:帧级别的进度感知视频描述。这个新任务旨在生成具有精细时序细节的描述,不仅准确描述每个帧,还捕捉整个视频序列中动作的细微进展。尽管现有领先的视觉语言模型具有强大的能力,但它们往往难以辨别帧级差异的细微差别。为此,我们提出了ProgressCaptioner,一种旨在捕捉动作序列中细粒度时序动态的描述模型。同时,我们开发了FrameCap数据集以支持训练,以及FrameCapEval基准以评估描述质量。结果表明,ProgressCaptioner显著优于领先的描述模型,产生精确的描述,准确捕捉动作进展,为时序精度在视频描述中树立了新标准。最后,我们展示了该方法的实际应用,具体是在辅助关键帧选择和推进视频理解方面,凸显了其广泛的实用性。
引用
@article{arxiv.2412.02071,
title = {Progress-Aware Video Frame Captioning},
author = {Zihui Xue and Joungbin An and Xitong Yang and Kristen Grauman},
journal= {arXiv preprint arXiv:2412.02071},
year = {2025}
}
备注
Accepted by CVPR 2025, Project website: https://vision.cs.utexas.edu/projects/ProgressCaptioner/