中文

OV9D:开放词汇类别级 9D 物体姿态与尺寸估计

计算机视觉与模式识别 2024-03-20 v1 机器人学

摘要

本文研究了一个新的开放集问题——开放词汇类别级物体姿态与尺寸估计。给定任意新物体类别的人类文本描述,机器人代理需要预测目标物体在观测场景图像中的位置、朝向和尺寸。为实现这种泛化能力,我们首先引入了 OO3D-9D,一个为此任务构建的大规模照片级真实感数据集。OO3D-9D 源自 OmniObject3D,是类别级物体姿态与尺寸估计领域中规模最大、多样性最丰富的数据集。它包含了每个类别对称轴的额外标注,有助于解决对称歧义性。除了大规模数据集,我们发现实现这种泛化能力的另一个关键在于利用预训练视觉-语言基础模型中的强先验知识。随后,我们提出了一个基于预训练 DinoV2 和文本到图像稳定扩散模型的框架,用于推断目标实例的归一化物体坐标空间(NOCS)图。该框架充分利用了 DinoV2 的视觉语义先验以及文本到图像扩散模型内对齐的视觉与语言知识,从而能够泛化到新类别的各种文本描述。全面的定量和定性实验表明,所提出的开放词汇方法在我们的大规模合成数据上训练后,显著优于基线方法,并能有效泛化到未见类别的真实世界图像。项目页面位于 https://ov9d.github.io。

关键词

引用

@article{arxiv.2403.12396,
  title  = {OV9D: Open-Vocabulary Category-Level 9D Object Pose and Size Estimation},
  author = {Junhao Cai and Yisheng He and Weihao Yuan and Siyu Zhu and Zilong Dong and Liefeng Bo and Qifeng Chen},
  journal= {arXiv preprint arXiv:2403.12396},
  year   = {2024}
}