中文

句子指定的动态视频缩略图生成

计算机视觉与模式识别 2019-10-17 v2

摘要

随着互联网上视频的急剧增长,提供视频内容预览的视频缩略图对影响用户在线搜索体验变得日益关键。传统视频缩略图仅基于视频的视觉特征生成一次,随后按请求展示。因此,此类不考虑用户搜索意图的视频缩略图无法提供用户所关注的视频内容的有意义快照。本文中,我们定义了一项全新的任务,即句子指定的动态视频缩略图生成,其中生成的缩略图不仅提供原始视频内容的简洁预览,还通过与用户查询句子的语义对应动态关联用户的搜索意图。为应对这一挑战性任务,我们提出了一种新颖的图卷积视频缩略图指针(GTP)。具体而言,GTP利用句子指定的视频图卷积网络对句子-视频语义交互以及融入句子信息的视频内部关系进行建模,并基于此引入时序条件指针网络顺序生成句子指定的视频缩略图。此外,我们基于ActivityNet Captions为所提新任务标注了一个新数据集,其包含10,000+视频-句子对,每对附有标注的句子指定视频缩略图。我们证明所提GTP在创建的数据集上优于若干基线方法,并相信我们的初步结果及新数据集的发布将启发进一步关于句子指定的动态视频缩略图生成的研究。数据集与代码见https://github.com/yytzsy/GTP。

关键词

引用

@article{arxiv.1908.04052,
  title  = {Sentence Specified Dynamic Video Thumbnail Generation},
  author = {Yitian Yuan and Lin Ma and Wenwu Zhu},
  journal= {arXiv preprint arXiv:1908.04052},
  year   = {2019}
}