基于记忆网络的360度视频故事化时间摘要方法
计算机视觉与模式识别
2018-06-19 v3
摘要
我们解决长 360{\deg} 视频的故事化时间摘要问题。我们提出一种名为过去-未来记忆网络(PFMN)的新型记忆网络模型,其中我们首先计算从输入 360{\deg} 视频中裁剪出的 81 个正常视场(NFOV)区域提议的分数,然后使用具有两个外部记忆的网络恢复一个潜在的、集体的摘要,这两个外部记忆分别存储先前选定子镜头和未来候选子镜头的嵌入。我们的主要贡献有两点。首先,我们的工作是首个解决 360{\deg} 视频故事化时间摘要的。其次,我们的模型是首个利用记忆网络进行视频摘要任务的尝试。为评估,我们进行了三组实验。首先,我们在 Pano2Vid 数据集上考察我们模型的视角选择能力。其次,我们在一个新收集的 360{\deg} 视频数据集上评估时间摘要。最后,我们在另一领域用基于图像的讲故事 VIST 数据集测试了我们模型的性能。我们验证了我们的模型在所有任务上均达到了最先进的性能。
引用
@article{arxiv.1805.02838,
title = {A Memory Network Approach for Story-based Temporal Summarization of 360{\deg} Videos},
author = {Sangho Lee and Jinyoung Sung and Youngjae Yu and Gunhee Kim},
journal= {arXiv preprint arXiv:1805.02838},
year = {2018}
}
备注
Accepted paper at CVPR 2018