基于多视图关键点对应的单目图像物体位姿估计
计算机视觉与模式识别
2018-09-05 v1
摘要
理解二维图像中物体的几何与位姿是广泛真实世界应用的基本需求。在深度神经网络的驱动下,近期方法为物体位姿估计带来了显著改进。然而,它们受限于带关键点/位姿标注的真实图像稀缺,因而无法有效利用物体的三维结构信息。在本工作中,我们提出一种数据高效的方法,利用类内物体的几何规则性进行位姿估计。首先,我们从简单的二维 RGB 图像中学习物体部件的位姿不变局部描述子。这些描述子,连同从固定三维模板模型渲染获得的关键点,随后被用于为给定单目真实图像生成关键点对应图。最后,一个位姿估计网络利用这些对应图预测物体的三维位姿。该流程进一步扩展为多视图方法,其吸收从三维模板模型多个视图生成的对应集合中的关键点信息。多视图信息的融合显著改善了系统的几何理解,进而提升了位姿估计性能。此外,负责位姿不变关键点描述子学习的对应框架的使用也使我们能有效缓解数据稀缺问题。这使我们的方法在多个真实图像视角估计数据集(如 Pascal3D+ 和 ObjectNet3D)上达到最先进性能。为促进可复现研究,我们已发布所提方法的代码。
引用
@article{arxiv.1809.00553,
title = {Object Pose Estimation from Monocular Image using Multi-View Keypoint Correspondence},
author = {Jogendra Nath Kundu and Rahul M. V. and Aditya Ganeshan and R. Venkatesh Babu},
journal= {arXiv preprint arXiv:1809.00553},
year = {2018}
}
备注
Accepted in ECCV-W; Code available at this http url: https://github.com/val-iisc/pose_estimation