DiffPoseNet:直接可微相机位姿估计
计算机视觉与模式识别
2022-03-22 v1 机器人学
摘要
当前用于相机位姿估计的深度神经网络方法依赖场景结构进行 3D 运动估计,但这降低了鲁棒性,从而使跨数据集泛化变得困难。相比之下,经典的从运动恢复结构方法利用光流估计 3D 运动,再计算深度;然而其精度强烈依赖于光流质量。为避免该问题,已有直接法被提出,其将 3D 运动与深度估计分离,但仅使用法向流形式的图像梯度计算 3D 运动。本文中,我们引入用于法向流估计的网络 NFlowNet,以施加鲁棒且直接的约束。具体地,法向流基于切性(深度正性)约束用于估计相对相机位姿。我们通过将优化问题表述为可微切性层来实现这一点,从而允许相机位姿的端到端学习。我们对所提 DiffPoseNet 对噪声的敏感性和跨数据集泛化进行了广泛的定性与定量评估。我们在 KITTI、TartanAir 和 TUM-RGBD 数据集上与现有最先进方法进行比较。
引用
@article{arxiv.2203.11174,
title = {DiffPoseNet: Direct Differentiable Camera Pose Estimation},
author = {Chethan M. Parameshwara and Gokul Hari and Cornelia Fermüller and Nitin J. Sanket and Yiannis Aloimonos},
journal= {arXiv preprint arXiv:2203.11174},
year = {2022}
}
备注
10 pages, 5 figures, Accepted to CVPR 2022