VidLoc:一种用于 6-DoF 视频片段重定位的深度时空模型
计算机视觉与模式识别
2017-08-01 v2
摘要
机器学习技术,即卷积神经网络(CNN)和回归森林,最近在单目图像的 6-DoF 定位中展现出巨大潜力。然而,在大多数情况下,图像序列而非单张图像是现成可用的。就此而言,现有基于学习的方法均未利用时序平滑性这一宝贵约束,常常导致每帧误差大于相机运动的情况。本文提出一种用于执行视频片段 6-DoF 定位的循环模型。我们发现,即使仅考虑短序列(20 帧),位姿估计也能得到平滑,且定位误差可大幅降低。最后,我们考虑了从模型获取概率位姿估计的方法。我们在公开可用的真实世界自动驾驶和室内定位数据集上评估了我们的方法。
引用
@article{arxiv.1702.06521,
title = {VidLoc: A Deep Spatio-Temporal Model for 6-DoF Video-Clip Relocalization},
author = {Ronald Clark and Sen Wang and Andrew Markham and Niki Trigoni and Hongkai Wen},
journal= {arXiv preprint arXiv:1702.06521},
year = {2017}
}
备注
To appear at CVPR 2017