PoseCNN:一种用于杂乱场景中 6D 物体位姿估计的卷积神经网络
计算机视觉与模式识别
2018-05-29 v3 机器人学
摘要
估计已知物体的 6D 位姿对于机器人与真实世界交互十分重要。由于物体的多样性以及由物体间杂乱和遮挡引起的场景复杂性,该问题具有挑战性。在本工作中,我们提出 PoseCNN,一种用于 6D 物体位姿估计的新卷积神经网络。PoseCNN 通过在图像中定位物体中心并预测其到相机的距离来估计物体的 3D 平移。物体的 3D 旋转通过回归到四元数表示来估计。我们还提出了一种新颖的损失函数,使 PoseCNN 能够处理对称物体。此外,我们贡献了一个用于 6D 物体位姿估计的大规模视频数据集,名为 YCB-Video 数据集。我们的数据集提供了来自 YCB 数据集的 21 个物体在 92 个视频、133,827 帧中观测到的准确 6D 位姿。我们在 YCB-Video 数据集和 OccludedLINEMOD 数据集上进行了大量实验,表明 PoseCNN 对遮挡具有高度鲁棒性,能够处理对称物体,并且仅以彩色图像作为输入即可提供准确的位姿估计。当使用深度数据进一步细化位姿时,我们的方法在具有挑战性的 OccludedLINEMOD 数据集上取得了 state-of-the-art 结果。我们的代码和数据集可在 https://rse-lab.cs.washington.edu/projects/posecnn/ 获取。
引用
@article{arxiv.1711.00199,
title = {PoseCNN: A Convolutional Neural Network for 6D Object Pose Estimation in Cluttered Scenes},
author = {Yu Xiang and Tanner Schmidt and Venkatraman Narayanan and Dieter Fox},
journal= {arXiv preprint arXiv:1711.00199},
year = {2018}
}
备注
Accepted to RSS 2018