中文

KeyPose:面向透明物体的多视角3D标注与关键点估计

计算机视觉与模式识别 2020-05-20 v2 机器学习 机器人学

摘要

估计桌面物体的3D姿态对于机器人操控等应用至关重要。许多解决该问题的现有方法在训练和预测时均需要物体的深度图,这限制了它们只能用于在不透明、朗伯物体上产生良好返回值的RGBD传感器。在本文中我们弃用深度传感器而采用原始立体输入。我们解决两个问题:第一,我们建立了一种利用RGB相机在桌面物体上捕获和标注3D关键点的简便方法;第二,我们开发了称为KeyPoseKeyPose的深度神经网络,它从立体输入中学习利用3D关键点准确预测物体姿态,且即便对透明物体也有效。为评估我们方法的性能,我们创建了一个包含五个类别15个透明物体、具有48K张3D关键点标注图像的数据集。我们训练了实例模型和类别模型,并展示了对新纹理、姿态和物体的泛化能力。KeyPose在该数据集上的3D姿态估计中超越SOTA性能达1.5至3.5倍,即便在竞争方法被提供真实深度的情况下也是如此。立体输入对该性能至关重要,因为与单目输入相比它将结果提升了2倍。我们将发布数据捕获与标注流水线、透明物体数据库以及KeyPose模型和评估代码的公开版本。项目网站:https://sites.google.com/corp/view/keypose。

关键词

引用

@article{arxiv.1912.02805,
  title  = {KeyPose: Multi-View 3D Labeling and Keypoint Estimation for Transparent Objects},
  author = {Xingyu Liu and Rico Jonschkowski and Anelia Angelova and Kurt Konolige},
  journal= {arXiv preprint arXiv:1912.02805},
  year   = {2020}
}

备注

CVPR 2020