中文

视频中事件的密集描述生成

计算机视觉与模式识别 2017-05-03 v1

摘要

大多数自然视频包含大量事件。例如,在“男人弹钢琴”的视频中,视频也可能包含“另一个男人跳舞”或“人群鼓掌”。我们引入了密集描述事件(dense-captioning events)的任务,其涉及检测并描述视频中的事件。我们提出了一种新模型,能够在单次视频遍历中识别所有事件,同时用自然语言描述检测到的事件。我们的模型引入了现有提议模块的一个变体,旨在捕捉短至及长达数分钟的长事件。为捕捉视频中事件间的依赖关系,我们的模型引入了一个新的描述生成模块,该模块利用来自过去和未来事件的上下文信息联合描述所有事件。我们还引入了 ActivityNet Captions,一个用于密集描述事件的大规模基准。ActivityNet Captions 包含 20k 视频,总计 849 视频小时,带有 100k 条总描述,每条有其唯一的开始和结束时间。最后,我们报告了我们的模型在密集描述事件、视频检索和定位上的性能。

关键词

引用

@article{arxiv.1705.00754,
  title  = {Dense-Captioning Events in Videos},
  author = {Ranjay Krishna and Kenji Hata and Frederic Ren and Li Fei-Fei and Juan Carlos Niebles},
  journal= {arXiv preprint arXiv:1705.00754},
  year   = {2017}
}

备注

16 pages, 16 figures