HSCNet++:基于 Transformer 的分层场景坐标分类与回归视觉定位方法
计算机视觉与模式识别
2023-05-08 v1
摘要
视觉定位对计算机视觉与机器人领域的诸多应用至关重要。针对单图像 RGB 定位,最先进的基于特征的方法在查询图像与预构建的 3D 模型之间匹配局部描述子。近来,深度神经网络被用于回归原始像素与场景中 3D 坐标之间的映射,从而通过前向传播隐式地完成匹配。然而,在庞大且模糊的环境中,单一网络直接学习此类回归任务较为困难。本工作中,我们提出一种新的分层场景坐标网络,以从单张 RGB 图像以由粗到精的方式预测像素场景坐标。所提方法为 HSCNet 的扩展,使我们能够训练紧凑模型并稳健地扩展至大型环境。它在 7-Scenes、12 Scenes、Cambridge Landmarks 数据集及合并室内场景上确立了单图像定位的新 SOTA。
引用
@article{arxiv.2305.03595,
title = {HSCNet++: Hierarchical Scene Coordinate Classification and Regression for Visual Localization with Transformer},
author = {Shuzhe Wang and Zakaria Laskar and Iaroslav Melekhov and Xiaotian Li and Yi Zhao and Giorgos Tolias and Juho Kannala},
journal= {arXiv preprint arXiv:2305.03595},
year = {2023}
}