Pix2Pose:用于 6D 姿态估计的像素级物体坐标回归
计算机视觉与模式识别
2020-03-24 v1
摘要
仅使用 RGB 图像估计物体的 6D 姿态仍然具有挑战性,因为存在遮挡和对称性等问题。此外,在没有专业知识或专用扫描设备的情况下,构建具有精确纹理的 3D 模型也很困难。为解决这些问题,我们提出了一种新颖的姿态估计方法 Pix2Pose,它无需纹理模型即可预测每个物体像素的 3D 坐标。设计了一种自编码器架构来估计每个像素的 3D 坐标和预期误差。这些像素级预测随后在多个阶段中用于形成 2D-3D 对应关系,以通过带 RANSAC 迭代的 PnP 算法直接计算姿态。我们的方法通过利用生成对抗训练的最新成果来精确恢复被遮挡部分,从而对遮挡具有鲁棒性。此外,提出了一种新颖的损失函数——变换器损失(transformer loss),通过引导预测到最接近对称姿态来处理对称物体。在包含对称和遮挡物体的三个不同基准数据集上的评估表明,我们的方法仅使用 RGB 图像就优于当前最优(SOTA)方法。
引用
@article{arxiv.1908.07433,
title = {Pix2Pose: Pixel-Wise Coordinate Regression of Objects for 6D Pose Estimation},
author = {Kiru Park and Timothy Patten and Markus Vincze},
journal= {arXiv preprint arXiv:1908.07433},
year = {2020}
}
备注
Accepted at ICCV 2019 (Oral)