中文

流式密集视频字幕

计算机视觉与模式识别 2024-04-02 v1

摘要

密集视频字幕的理想模型——预测视频中时间定位的字幕——应能处理长输入视频,预测丰富、详细的文本描述,并能在处理完整个视频之前产生输出。然而,当前的先进模型处理固定数量的下采样帧,并在看到整个视频后做出单一的完整预测。我们提出一个流式密集视频字幕模型,包含两个新颖组件:首先,我们提出一个新的记忆模块,基于对传入令牌进行聚类,由于记忆大小固定,它可以处理任意长的视频。其次,我们开发了一个流式解码算法,使我们的模型能够在整个视频处理完成之前做出预测。我们的模型实现了这种流式能力,并在三个密集视频字幕基准测试上显著提升了当前最优水平:ActivityNet、YouCook2和ViTT。我们的代码发布在https://github.com/google-research/scenic。

关键词

引用

@article{arxiv.2404.01297,
  title  = {Streaming Dense Video Captioning},
  author = {Xingyi Zhou and Anurag Arnab and Shyamal Buch and Shen Yan and Austin Myers and Xuehan Xiong and Arsha Nagrani and Cordelia Schmid},
  journal= {arXiv preprint arXiv:2404.01297},
  year   = {2024}
}

备注

CVPR 2024. Code is available at https://github.com/google-research/scenic/tree/main/scenic/projects/streaming_dvc