中文

MV6D:基于深度逐点投票网络在 RGB-D 帧上的多视角 6D 位姿估计

计算机视觉与模式识别 2022-08-03 v1 人工智能 机器学习

摘要

估计物体的 6D 位姿是一项基础的计算机视觉任务。然而,大多数传统方法依赖于单一视角的相机数据,因此受遮挡影响。我们通过我们新颖的多视角 6D 位姿估计方法 MV6D 克服了这一问题,该方法基于多视角的 RGB-D 图像准确预测杂乱场景中全部物体的 6D 位姿。我们的方法基于 PVN3D 网络,该网络使用单张 RGB-D 图像预测目标物体的关键点。我们通过使用来自多视角的组合点云并用 DenseFusion 层融合各视角图像来扩展此方法。与当前的多视角位姿检测网络(如 CosyPose)不同,我们的 MV6D 能够以端到端方式学习多视角的融合,且不需要多个预测阶段或后续的预测微调。此外,我们提出了三个具有严重遮挡的杂乱场景的新颖照片级真实感数据集。它们都包含多视角的 RGB-D 图像以及实例语义分割和 6D 位姿估计的真值。MV6D 即使在相机位姿不精确已知的情况下也显著优于多视角 6D 位姿估计的当前最优方法。此外,我们表明我们的方法对动态相机设置具有鲁棒性,并且其精度随视角数量增加而逐步提升。

关键词

引用

@article{arxiv.2208.01172,
  title  = {MV6D: Multi-View 6D Pose Estimation on RGB-D Frames Using a Deep Point-wise Voting Network},
  author = {Fabian Duffhauss and Tobias Demmler and Gerhard Neumann},
  journal= {arXiv preprint arXiv:2208.01172},
  year   = {2022}
}

备注

Accepted at IROS 2022