中文

Multi3DRefer:将文本描述定位到多个3D物体

计算机视觉与模式识别 2023-09-12 v1

摘要

我们提出了利用自然语言描述在真实世界3D场景中定位任意数量物体的任务。现有的3D视觉定位任务侧重于给定文本描述定位唯一物体。然而,这种严格设定并不自然,因为定位潜在多个物体是真实场景与机器人任务(如视觉导航与物体重排)中的常见需求。为解决此设定,我们提出Multi3DRefer,对ScanRefer数据集与任务进行了泛化。我们的数据集包含61926条描述,涉及11609个物体,其中每条描述引用零个、单个或多个目标物体。我们还引入了一种新的评估指标,并对已有工作的方法进行基准测试,以促进对多模态3D场景理解的进一步研究。此外,我们开发了一个更好的基线,通过在线渲染物体提议并结合对比学习来利用来自CLIP的2D特征,其在ScanRefer基准上优于当前最优方法。

关键词

引用

@article{arxiv.2309.05251,
  title  = {Multi3DRefer: Grounding Text Description to Multiple 3D Objects},
  author = {Yiming Zhang and ZeMing Gong and Angel X. Chang},
  journal= {arXiv preprint arXiv:2309.05251},
  year   = {2023}
}

备注

ICCV 2023