中文

POPE:基于单参考在任意场景中估计任意物体的 6 自由度可提示位姿

计算机视觉与模式识别 2023-05-26 v1

摘要

尽管六自由度(6DoF)物体位姿估计取得了显著进展,现有方法在涉及具身智能体与下游 3D 视觉任务的真实场景中的适用性仍有限。这些局限主要源于对 3D 模型、封闭类别检测以及大量密集标注支持视图的需求。为缓解该问题,我们提出一种物体位姿估计的通用范式,称为可提示物体位姿估计(Promptable Object Pose Estimation, POPE)。所提方法 POPE 可在任意场景中对任意目标物体实现零样本 6DoF 物体位姿估计,同时仅采用单一参考作为支持视图。为实现此目标,POPE 利用预训练的大规模 2D 基础模型之力,采用具有层次化特征表示与 3D 几何原理的框架。此外,它估计物体提示与新视图中目标物体间的相对相机位姿,从而支持双视图与多视图 6DoF 位姿估计任务。综合实验结果表明,POPE 在零样本设定下展现出无与伦比的鲁棒性能,在 LINEMOD 与 OnePose 数据集上平均中位位姿误差分别显著降低了 52.38% 与 50.47%。我们还在因果采集图像(见图 1)上进行了更具挑战性的测试,进一步证明了 POPE 的鲁棒性。项目页面见 https://paulpanwang.github.io/POPE/。

关键词

引用

@article{arxiv.2305.15727,
  title  = {POPE: 6-DoF Promptable Pose Estimation of Any Object, in Any Scene, with One Reference},
  author = {Zhiwen Fan and Panwang Pan and Peihao Wang and Yifan Jiang and Dejia Xu and Hanwen Jiang and Zhangyang Wang},
  journal= {arXiv preprint arXiv:2305.15727},
  year   = {2023}
}