中文

OSCAR:从语言提示和单张图像进行开放集CAD检索

计算机视觉与模式识别 2026-01-13 v1 机器人学

摘要

6D物体姿态估计在机器人和增强现实等应用场景的场景理解中发挥着关键作用。为满足不断变化的对象集的需求,开发了无需对象特定训练、仅依赖CAD模型的零样检测器。然而,一旦部署,这些模型难以获得获取,持续变化和增长的对象集合更难可靠地识别感兴趣的实例模型。为此,我们引入一种从语言提示和单张图像进行开放集CAD检索(OSCAR),这是一种无需训练的方法,可从无标签3D对象数据库中检索匹配对象模型。在接入阶段,OSCAR生成数据库模型的多视角渲染,并使用图像描述模型为其标注描述性标题。在推理阶段,GroundedSAM检测查询对象在输入图像中的位置,计算区域感兴趣部位和数据库标题的多模态嵌入。OSCAR采用两阶段检索:使用CLIP进行基于文本的过滤以确定候选模型,然后使用DINOv2进行基于图像的细化以选择最视觉相似的对象。在我们的实验中,我们证明OSCAR在跨域3D模型检索基准MI3DOR上超越所有最先进的方法。此外,我们展示OSCAR直接适用于自动化对象模型获取以进行6D物体姿态估计。我们提议如果确切实例不可用,则使用最相似的对象模型进行姿态估计,并显示OSCAR在YCB-V对象数据集上的对象检索平均精度达到90.48%。我们还展示,最相似的对象模型可用于使用Megapose进行姿态估计,优于基于重建的方法。

关键词

引用

@article{arxiv.2601.07333,
  title  = {OSCAR: Open-Set CAD Retrieval from a Language Prompt and a Single Image},
  author = {Tessa Pulli and Jean-Baptiste Weibel and Peter Hönig and Matthias Hirschmanner and Markus Vincze and Andreas Holzinger},
  journal= {arXiv preprint arXiv:2601.07333},
  year   = {2026}
}