使用自然语言定位视频中的时刻
计算机视觉与模式识别
2017-08-08 v1
摘要
我们考虑根据自然语言文本描述从视频中检索特定的时序片段,即时刻。为使用自然语言检索整个视频片段而设计的方法能够确定视频中发生了什么,但无法确定发生的时间。为解决这一问题,我们提出了时刻上下文网络(MCN),该网络通过在时间上整合局部和全局视频特征,有效地在视频中定位自然语言查询。训练 MCN 模型的一个关键障碍是,当前的视频数据集不包含已定位的视频片段与指代表达式(即唯一标识对应时刻的文本描述)的配对。因此,我们收集了 Distinct Describable Moments(DiDeMo)数据集,该数据集包含超过 10,000 个未经编辑的个人视频,涵盖多样的视觉场景,并配有已定位的视频片段与指代表达式的配对。我们证明 MCN 优于多种基线方法,并相信我们的初步结果以及 DiDeMo 的发布将激发更多关于使用自然语言定位视频时刻的研究。
引用
@article{arxiv.1708.01641,
title = {Localizing Moments in Video with Natural Language},
author = {Lisa Anne Hendricks and Oliver Wang and Eli Shechtman and Josef Sivic and Trevor Darrell and Bryan Russell},
journal= {arXiv preprint arXiv:1708.01641},
year = {2017}
}
备注
ICCV 2017