给定带解说 360° 视频的自视 grounding
计算机视觉与模式识别
2017-11-27 v1
摘要
带解说的 360° 视频在许多游览场景中被提供以模拟真实世界体验。然而,先前工作表明智能辅助(即提供视觉引导)能显著帮助用户跟随与解说相对应的正常视场(NFoV)。在本项目中,我们旨在给定解说字幕的情况下自动 grounding 360° 视频的 NFoV(称为“NFoV-grounding”)。我们提出一种新颖的视觉 Grounding 模型(VGM),以在给定视频内容与字幕时隐式且高效地预测 NFoV。具体而言,在每一帧,我们使用卷积神经网络(CNN)将全景高效编码为候选 NFoV 的特征图,并使用带门控循环单元(GRU)的 RNN 将字幕编码至同一隐藏空间。然后,我们对候选 NFoV 施加软注意力以触发句子解码器,旨在最小化生成句子与给定句子间的重建损失。最后,我们得到具有最大注意力的候选 NFoV 作为 NFoV,且无需任何人类监督。为更鲁棒地训练 VGM,我们还生成以一减去软注意力为条件的反向句子,使得注意力聚焦于与给定句子相关性较小的候选 NFoV。该反向句子的负对数重建损失(称为“不相关损失”)被联合最小化以鼓励反向句子不同于给定句子。为评估我们的方法,我们收集了首个带解说 360° 视频数据集并取得了最先进的 NFoV-grounding 性能。
引用
@article{arxiv.1711.08664,
title = {Self-view Grounding Given a Narrated 360{\deg} Video},
author = {Shih-Han Chou and Yi-Chun Chen and Kuo-Hao Zeng and Hou-Ning Hu and Jianlong Fu and Min Sun},
journal= {arXiv preprint arXiv:1711.08664},
year = {2017}
}