中文

基于记忆网络的360度视频故事化时间摘要方法

计算机视觉与模式识别 2018-06-19 v3

摘要

我们解决长 360{\deg} 视频的故事化时间摘要问题。我们提出一种名为过去-未来记忆网络(PFMN)的新型记忆网络模型,其中我们首先计算从输入 360{\deg} 视频中裁剪出的 81 个正常视场(NFOV)区域提议的分数,然后使用具有两个外部记忆的网络恢复一个潜在的、集体的摘要,这两个外部记忆分别存储先前选定子镜头和未来候选子镜头的嵌入。我们的主要贡献有两点。首先,我们的工作是首个解决 360{\deg} 视频故事化时间摘要的。其次,我们的模型是首个利用记忆网络进行视频摘要任务的尝试。为评估,我们进行了三组实验。首先,我们在 Pano2Vid 数据集上考察我们模型的视角选择能力。其次,我们在一个新收集的 360{\deg} 视频数据集上评估时间摘要。最后,我们在另一领域用基于图像的讲故事 VIST 数据集测试了我们模型的性能。我们验证了我们的模型在所有任务上均达到了最先进的性能。

关键词

引用

@article{arxiv.1805.02838,
  title  = {A Memory Network Approach for Story-based Temporal Summarization of 360{\deg} Videos},
  author = {Sangho Lee and Jinyoung Sung and Youngjae Yu and Gunhee Kim},
  journal= {arXiv preprint arXiv:1805.02838},
  year   = {2018}
}

备注

Accepted paper at CVPR 2018