视频中事件的密集描述生成
计算机视觉与模式识别
2017-05-03 v1
摘要
大多数自然视频包含大量事件。例如,在“男人弹钢琴”的视频中,视频也可能包含“另一个男人跳舞”或“人群鼓掌”。我们引入了密集描述事件(dense-captioning events)的任务,其涉及检测并描述视频中的事件。我们提出了一种新模型,能够在单次视频遍历中识别所有事件,同时用自然语言描述检测到的事件。我们的模型引入了现有提议模块的一个变体,旨在捕捉短至及长达数分钟的长事件。为捕捉视频中事件间的依赖关系,我们的模型引入了一个新的描述生成模块,该模块利用来自过去和未来事件的上下文信息联合描述所有事件。我们还引入了 ActivityNet Captions,一个用于密集描述事件的大规模基准。ActivityNet Captions 包含 20k 视频,总计 849 视频小时,带有 100k 条总描述,每条有其唯一的开始和结束时间。最后,我们报告了我们的模型在密集描述事件、视频检索和定位上的性能。
引用
@article{arxiv.1705.00754,
title = {Dense-Captioning Events in Videos},
author = {Ranjay Krishna and Kenji Hata and Frederic Ren and Li Fei-Fei and Juan Carlos Niebles},
journal= {arXiv preprint arXiv:1705.00754},
year = {2017}
}
备注
16 pages, 16 figures