中文

Uni6D:一种无投影断裂的统一CNN框架用于6D位姿估计

计算机视觉与模式识别 2022-04-06 v2

摘要

随着RGB-D传感器愈发廉价,使用RGB-D图像获得高精度的6D位姿估计结果成为更佳选择。最先进的方法通常使用不同骨干网络提取RGB与深度图像特征:对RGB图像使用2D CNN,对深度数据使用逐像素点云网络,以及用于特征融合的融合网络。我们发现使用两个独立骨干的本质原因在于“投影断裂”问题。在深度图像平面中,物理世界的投影3D结构由1D深度值及其内置2D像素坐标(UV)保存。任何修改UV的空间变换,如CNN流程中的缩放、翻转、裁剪或池化操作,都会破坏像素值与UV坐标的绑定。结果,修改后的深度图像或特征不再保存3D结构。为解决此问题,我们提出一种简单而有效的方法Uni6D,显式地将额外UV数据与RGB-D图像一同作为输入。我们的方法具有用于6D位姿估计的统一CNN框架与单一CNN骨干。具体而言,方法架构基于Mask R-CNN并带有两个额外头:一个称为RT头用于直接预测6D位姿,另一个称为abc头用于将可见点映射到其3D模型坐标以作为辅助模块引导网络。这种端到端方法兼顾简洁与准确,在YCB-Video数据集上取得了与最优方法相当的精度以及7.2倍的推理速度。

关键词

引用

@article{arxiv.2203.14531,
  title  = {Uni6D: A Unified CNN Framework without Projection Breakdown for 6D Pose Estimation},
  author = {Xiaoke Jiang and Donghai Li and Hao Chen and Ye Zheng and Rui Zhao and Liwei Wu},
  journal= {arXiv preprint arXiv:2203.14531},
  year   = {2022}
}

备注

CVPR2022