中文

基于深度学习的相机位姿回归的几何损失函数

计算机视觉与模式识别 2017-05-24 v2

摘要

深度学习已被证明对鲁棒且实时的单目图像重定位有效。特别地,PoseNet是一个深度卷积神经网络,学习从单幅图像回归六自由度相机位姿。它利用高级特征进行定位,并对困难光照、运动模糊和未知相机内参具有鲁棒性,而基于点的SIFT配准在此情况下会失败。然而,它使用朴素的损失函数进行训练,其超参数需要昂贵的调优。在本文中,我们对该问题给出了更基础的理论处理。我们探索了若干基于几何和场景重投影误差的用于学习相机位姿的新颖损失函数。此外,我们展示了如何自动学习最优权重以同时回归位置和朝向。通过利用几何,我们证明了我们的技术在从室内房间到小型城市的数据集上显著提升了PoseNet的性能。

关键词

引用

@article{arxiv.1704.00390,
  title  = {Geometric Loss Functions for Camera Pose Regression with Deep Learning},
  author = {Alex Kendall and Roberto Cipolla},
  journal= {arXiv preprint arXiv:1704.00390},
  year   = {2017}
}

备注

CVPR 2017