中文

何处播放:使用自然语言查询的视频片段检索

计算机视觉与模式识别 2017-07-04 v1

摘要

在本文中,我们提出了一种使用自然语言查询进行视频片段检索的新方法。与大多数先前的方法(如基于概念的方法或基于规则的结构化模型)不同,所提方法使用图像描述模型为视觉信息构建句子查询。具体而言,我们的方法利用通过‘Densecap’由每幅图像中的视觉特征生成的多个描述。然后,计算相邻图像描述之间的相似度,用于跨多帧跟踪语义相似的描述。除了引入这种“通过描述进行跟踪”的新颖思想外,所提方法还是首批使用由神经网络学习的语言生成模型来构建描述视觉信息关系和属性的语义查询的方法之一。为了评估我们方法的有效性,我们创建了一个新的评估数据集,其中包含20部电影预告片中约348个场景片段。通过定量和定性评估,我们表明我们的方法对于使用自然语言查询的视频片段检索是有效的。

关键词

引用

@article{arxiv.1707.00251,
  title  = {Where to Play: Retrieval of Video Segments using Natural-Language Queries},
  author = {Sangkuk Lee and Daesik Kim and Myunggi Lee and Jihye Hwang and Nojun Kwak},
  journal= {arXiv preprint arXiv:1707.00251},
  year   = {2017}
}