基于密集场景匹配的学习型相机定位方法
计算机视觉与模式识别
2021-04-01 v1
摘要
相机定位旨在从RGB图像中估计6自由度相机位姿。传统方法在查询图像与预构建的三维模型之间检测并匹配兴趣点。近期基于学习的方法将场景结构编码进特定的卷积神经网络(CNN)中,从而能够从RGB图像预测密集坐标。然而,其中多数方法在新场景上需要重新训练或重新适配,且由于网络容量有限而难以处理大规模场景。我们提出了一种使用密集场景匹配(DSM)的场景无关相机定位新方法,在查询图像与场景之间构建代价体。该代价体及对应坐标由CNN处理以预测密集坐标,随后可通过PnP算法求解相机位姿。此外,我们的方法可扩展至时间域,从而在测试时带来额外的性能提升。我们的场景无关方法在7scenes与Cambridge基准上取得了与现有场景相关方法(如KFNet)相当的精度,并显著优于最先进的场景无关密集坐标回归网络SANet。代码已发布于https://github.com/Tangshitao/Dense-Scene-Matching。
引用
@article{arxiv.2103.16792,
title = {Learning Camera Localization via Dense Scene Matching},
author = {Shitao Tang and Chengzhou Tang and Rui Huang and Siyu Zhu and Ping Tan},
journal= {arXiv preprint arXiv:2103.16792},
year = {2021}
}
备注
CVPR2021