定位视频字幕生成
计算机视觉与模式识别
2024-11-13 v1
摘要
我们提出了一项新任务、数据集和模型,用于定位视频字幕生成。该任务统一了视频字幕生成与目标定位,字幕中的目标通过时序一致的边界框在视频中定位。我们引入以下贡献。首先,给出任务定义和一个手工标注的测试数据集,称为定位视频字幕生成(GROC)。其次,引入一种大规模自动标注方法,利用现有的定位静止图像字幕模型配合大语言模型(LLM),将逐帧字幕汇总为视频中时序一致的字幕。此外,我们提示 LLM 通过语言进行追踪——将逐帧字幕中的名词短语分类为视频级生成字幕中的名词短语。我们将该方法应用于 HowTo100M 数据集的视频,获得一个新的大规模训练数据集 HowToGround,包含自动标注的字幕和时空一致的边界框及连贯的自然语言标签。第三,提出一种新的定位视频字幕生成模型 VideoGround,并在新的自动标注 HowToGround 数据集上训练。最后,VideoGround 模型的结果为定位视频字幕生成这一新任务确立了最先进水平。我们进行了广泛的消融实验,证明了模型关键技术贡献的重要性。
引用
@article{arxiv.2411.07584,
title = {Grounded Video Caption Generation},
author = {Evangelos Kazakos and Cordelia Schmid and Josef Sivic},
journal= {arXiv preprint arXiv:2411.07584},
year = {2024}
}