VS-Net:基于分割投票的视觉定位
计算机视觉与模式识别
2021-05-25 v1
摘要
视觉定位在机器人与计算机视觉中至关重要。近来,基于场景坐标回归的方法在小型静态场景的视觉定位中表现出良好性能。然而,它仍从大量劣质场景坐标估计相机位姿。为解决此问题,我们提出一种新颖视觉定位框架,通过一系列可学习的场景特定地标在查询图像与3D地图间建立2D-to-3D对应。在地标生成阶段,目标场景的3D表面被过分割为马赛克块,其中心被视为场景特定地标。为鲁棒且准确地恢复场景特定地标,我们提出分割投票网络(VS-Net),通过分割分支将像素分割至不同地标块,并通过地标位置投票分支估计各块内地标位置。由于场景中地标数量可达5000,以常用交叉熵损失训练如此多类别的分割网络在计算与内存上均代价高昂。我们提出一种基于原型的带难负样本挖掘的三元组损失,能高效训练具有大量标签的语义分割网络。我们提出的VS-Net在多个公开基准上广泛测试,优于最先进视觉定位方法。代码与模型见 \href{https://github.com/zju3dv/VS-Net}{https://github.com/zju3dv/VS-Net}。
引用
@article{arxiv.2105.10886,
title = {VS-Net: Voting with Segmentation for Visual Localization},
author = {Zhaoyang Huang and Han Zhou and Yijin Li and Bangbang Yang and Yan Xu and Xiaowei Zhou and Hujun Bao and Guofeng Zhang and Hongsheng Li},
journal= {arXiv preprint arXiv:2105.10886},
year = {2021}
}
备注
Project Page: https://drinkingcoder.github.io/publication/vs-net/