CenterSnap:单帧多目标三维形状重建与类别级六维位姿及尺寸估计
计算机视觉与模式识别
2022-03-04 v1 机器学习
机器人学
摘要
本文研究从单视角 RGB-D 观测同时进行多目标三维重建、六维位姿和尺寸估计的复杂任务。与实例级位姿估计不同,我们关注一个更具挑战性的问题,即在推理时不可用 CAD 模型。现有方法主要遵循复杂的多阶段流水线,首先定位并检测图像中每个目标实例,然后回归到它们的三维网格或六维位姿。这些方法在计算成本高且在存在遮挡的复杂多目标场景中性能较低。因此,我们提出一种简单的一阶段方法,以无边界框的方式联合预测三维形状并估计六维位姿和尺寸。具体而言,我们的方法将目标实例视为空间中心,其中每个中心表示目标的完整形状及其六维位姿和尺寸。通过这种逐像素表示,我们的方法可以实时(40 FPS)重建多个新颖目标实例并在单次前向传播中预测其六维位姿和尺寸。通过大量实验,我们证明我们的方法在 ShapeNet 和 NOCS 多目标数据集上分别显著优于所有形状补全和类别级六维位姿及尺寸估计基线,对于新颖真实世界目标实例的六维位姿 mAP 绝对提升 12.6%。
引用
@article{arxiv.2203.01929,
title = {CenterSnap: Single-Shot Multi-Object 3D Shape Reconstruction and Categorical 6D Pose and Size Estimation},
author = {Muhammad Zubair Irshad and Thomas Kollar and Michael Laskey and Kevin Stone and Zsolt Kira},
journal= {arXiv preprint arXiv:2203.01929},
year = {2022}
}
备注
Accepted to ICRA 2022, Project page with videos: https://zubair-irshad.github.io/projects/CenterSnap.html