中文

实时无缝单发 6D 物体位姿预测

计算机视觉与模式识别 2018-12-10 v5

摘要

我们提出一种单发方法,用于同时在 RGB 图像中检测物体并预测其 6D 位姿,无需多阶段或检验多个假设。不同于近期提出的该任务单发技术(Kehl 等人,ICCV'17)仅预测必须随后细化的近似 6D 位姿,我们的方法足够精确,无需额外后处理。因此,它快得多——在 Titan X (Pascal) GPU 上 50 fps——且更适合实时处理。我们方法的关键组件是一个受 YOLO 网络设计启发的新型 CNN 架构,其直接预测物体 3D 包围盒投影顶点的 2D 图像位置。随后使用 PnP 算法估计物体的 6D 位姿。在 LINEMOD 与 OCCLUSION 数据集上的单物体与多物体位姿估计中,当所有方法均不使用后处理时,我们的方法大幅优于其他近期基于 CNN 的方法。后处理中可使用位姿细化步骤提升已有方法的精度,但它们在 10 fps 或更低速度下远慢于我们的方法。

关键词

引用

@article{arxiv.1711.08848,
  title  = {Real-Time Seamless Single Shot 6D Object Pose Prediction},
  author = {Bugra Tekin and Sudipta N. Sinha and Pascal Fua},
  journal= {arXiv preprint arXiv:1711.08848},
  year   = {2018}
}

备注

CVPR 2018