提升基于网络的相关位姿回归的泛化能力:以降维作为正则化器
计算机视觉与模式识别
2020-10-27 v1 机器人学
摘要
视觉定位在增强现实、机器人和三维重建等诸多领域占据重要位置。最先进的视觉定位方法在 RANSAC 框架内使用基于几何的求解器进行位姿估计。然而,这些方法需要在高图像分辨率下准确的像素级匹配,在外观、动态或视角发生显著变化时难以满足。基于端到端学习的回归网络提供了一种规避精确像素级对应要求的方案,但在跨场景泛化方面表现不佳。本文在网络中显式添加一个可学习的匹配层,将位姿回归求解器与绝对图像特征值隔离,并对相关特征通道和图像尺度施加维度正则化,以进一步提升泛化性能和应对大视角变化的能力。我们在双层金字塔框架内实现该维度正则化策略,由粗到细回归定位结果。此外,融合深度信息以恢复绝对平移尺度。通过在真实世界 RGBD 数据集上的实验,我们验证了该设计在提升泛化性能和对视角变化的鲁棒性方面的有效性,并展示了基于回归的视觉定位网络在基于几何的视觉定位方法难以应对的挑战性场景中的潜力。
引用
@article{arxiv.2010.12796,
title = {Improving the generalization of network based relative pose regression: dimension reduction as a regularizer},
author = {Xiaqing Ding and Yue Wang and Li Tang and Yanmei Jiao and Rong Xiong},
journal= {arXiv preprint arXiv:2010.12796},
year = {2020}
}