重新审视 360° 视频中头部运动预测的深层架构
计算机视觉与模式识别
2021-04-15 v3 机器学习
图像与视频处理
机器学习
摘要
我们考虑在 360 度视频中预测用户头部运动,仅使用两种模态:用户过去的位置与视频内容(不知晓其他用户的轨迹)。我们作出两项主要贡献。首先,我们重新审视该问题的现有深度学习方法,并通过彻底的根因分析找出隐藏缺陷。其次,基于该分析结果,我们设计了一个达到最先进性能的新方案。首先,重新评估使用两种模态的现有方法,我们得到一个令人惊讶的结果:它们全都比仅使用用户轨迹的基线表现更差。对指标、数据集与神经架构的根因分析特别表明:(i) 内容可为长于 2 至 3 秒的预测视界提供信息(现有方法考虑更短视界);(ii) 要与基线竞争,必须有一个专门处理位置的循环单元,但这并不充分。其次,借助 Structural-RNN 概念对该问题重新考察,我们设计了一个名为 TRACK 的新深度神经架构。TRACK 在所有考虑的数据集与预测视界上均达到最先进性能,在聚焦型视频与 2–5 秒视界上比竞争对手高出至多 20%。整个框架(代码与数据集)已在线发布并获得了 ACM 可复现性徽章。
引用
@article{arxiv.1911.11702,
title = {Revisiting Deep Architectures for Head Motion Prediction in 360{\deg} Videos},
author = {Miguel Fabian Romero Rondon and Lucile Sassatelli and Ramon Aparicio Pardo and Frederic Precioso},
journal= {arXiv preprint arXiv:1911.11702},
year = {2021}
}