用于六自由度位姿估计的神经网格优化器
计算机视觉与模式识别
2020-03-27 v3 机器学习
摘要
我们如何有效利用单目二维图像信息来恢复视觉物体的六维位姿(6-DoF)?深度学习已被证明对鲁棒且实时的单目位姿估计是有效的。网络通常学习使用朴素损失函数回归6-DoF位姿。然而,由于直接回归的位姿估计缺乏几何场景理解,从三维物体渲染的网格与二维实例分割结果(例如边界框和掩码预测)之间存在错位。本文通过可微神经网格渲染器弥合了二维掩码生成与三维位置预测之间的差距。我们利用精确掩码预测与较不准确网格预测之间的叠加,以平移估计为重点迭代优化直接回归的6D位姿信息。通过利用几何,我们证明了我们的技术在困难的平移估计任务上显著改善了直接回归性能,并在Peking University/Baidu - Autonomous Driving数据集和ApolloScape 3D Car Instance数据集上取得了最先进的(SOTA)结果。代码可在\url{https://bit.ly/2IRihfU}找到。
引用
@article{arxiv.2003.07561,
title = {Neural Mesh Refiner for 6-DoF Pose Estimation},
author = {Di Wu and Yihao Chen and Xianbiao Qi and Yongjian Yu and Weixuan Chen and Rong Xiao},
journal= {arXiv preprint arXiv:2003.07561},
year = {2020}
}