迈向更好泛化:无 PoseNet 的联合深度-位姿学习
计算机视觉与模式识别
2021-09-06 v2 机器人学
摘要
本工作中,我们解决自监督联合深度-位姿学习中的尺度不一致本质问题。大多数现有方法假设可在所有输入样本上学习到深度与位姿的一致尺度,这使学习问题更困难,导致在室内环境和长序列视觉里程计应用中性能下降且泛化受限。为解决这个问题,我们提出一种显式将尺度从网络估计中解耦的新颖系统。我们的方法不依赖 PoseNet 架构,而是通过从稠密光流对应直接求解基础矩阵来恢复相对位姿,并利用两视图三角化模块恢复至尺度未知的 3D 结构。随后,我们将深度预测的尺度与三角化点云对齐,并使用变换后的深度图进行深度误差计算和稠密重投影检查。我们的整个系统可端到端联合训练。大量实验表明,我们的系统不仅在 KITTI 深度和光流估计上达到最先进性能,还显著提升了现有自监督深度-位姿学习方法在多种挑战性场景下的泛化能力,并在 KITTI Odometry 和 NYUv2 数据集上取得自监督基于学习的方法中的最先进结果。此外,我们展示了关于基于 PoseNet 的相对位姿估计方法在泛化能力方面局限的一些有趣发现。代码见 https://github.com/B1ueber2y/TrianFlow。
引用
@article{arxiv.2004.01314,
title = {Towards Better Generalization: Joint Depth-Pose Learning without PoseNet},
author = {Wang Zhao and Shaohui Liu and Yezhi Shu and Yong-Jin Liu},
journal= {arXiv preprint arXiv:2004.01314},
year = {2021}
}
备注
To appear in CVPR 2020