中文

GDRNPP:一种几何引导且完全基于学习的物体位姿估计器

计算机视觉与模式识别 2025-03-25 v5 机器人学

摘要

刚体物体的 6D 位姿估计是计算机视觉中一项长期且富有挑战的任务。近年来,深度学习的出现揭示了卷积神经网络(CNNs)预测可靠 6D 位姿的潜力。鉴于直接位姿回归网络目前表现欠佳,多数方法仍不同程度地借助传统技术。例如,性能最优的方法常采用间接策略:先建立 2D-3D 或 3D-3D 对应,再应用基于 RANSAC 的 PnP 或 Kabsch 算法,并进一步使用 ICP 进行精化。尽管性能有所提升,传统技术的引入使网络耗时且无法端到端训练。与之正交,本文提出一种完全基于学习的物体位姿估计器。工作中,我们首先深入调研直接与间接方法,并提出一种简洁而有效的几何引导直接回归网络(GDRN),以端到端方式从单目图像学习 6D 位姿。随后,我们引入几何引导位姿精化模块,在具备额外深度数据时提升位姿精度。在预测坐标图的引导下,我们构建了端到端可微架构,在观测与渲染的 RGB-D 图像间建立鲁棒且准确的 3D-3D 对应以精化位姿。我们增强的位姿估计流程 GDRNPP (GDRN Plus Plus) 连续两年登顶 BOP Challenge 排行榜,成为首个在精度与速度上均超越所有依赖传统技术的先前方法。代码与模型见 https://github.com/shanice-l/gdrnpp_bop2022。

关键词

引用

@article{arxiv.2102.12145,
  title  = {GDRNPP: A Geometry-guided and Fully Learning-based Object Pose Estimator},
  author = {Xingyu Liu and Ruida Zhang and Chenyangguang Zhang and Gu Wang and Jiwen Tang and Zhigang Li and Xiangyang Ji},
  journal= {arXiv preprint arXiv:2102.12145},
  year   = {2025}
}

备注

accepted by IEEE Transactions on Pattern Analysis and Machine Intelligence (TPAMI), code: https://github.com/shanice-l/gdrnpp_bop2022