中文

Reasoning3D——三维空间中的定位与推理:基于大型视觉语言模型的细粒度零样本开放词汇三维推理部件分割

计算机视觉与模式识别 2024-05-30 v1 图形学 人机交互

摘要

本文提出一项新任务:面向物体部件搜索与定位的零样本三维推理分割。这是一种超越以往类别特定三维语义分割、三维实例分割和开放词汇三维分割局限的三维分割新范式。我们设计了一个简单的基线方法Reasoning3D,它能够理解并执行复杂指令,对三维网格进行(细粒度)特定部件分割,具备上下文感知能力,并能对交互式分割给出推理答案。具体而言,Reasoning3D利用现成的预训练二维分割网络,借助大型语言模型(LLM)以零样本方式解释用户输入查询。先前研究表明,大规模预训练赋予基础模型先验世界知识,使其能够理解复杂指令——这一能力可被用来在有限三维数据集(源高效)条件下“分割任何物体”。实验表明,我们的方法具有泛化能力,能够基于隐式文本查询有效定位并高亮三维物体(三维网格)的部件,包括铰接式三维物体和真实世界扫描数据。我们的方法还能生成与这些三维模型及其分解相对应的自然语言解释。此外,我们的免训练方法允许快速部署,可作为未来在机器人、物体操作、部件组装、自动驾驶、增强现实/虚拟现实(AR/VR)以及医疗应用等各领域进行部件级三维(语义)物体理解研究的通用基线。代码、模型权重、部署指南和评估协议见:http://tianrun-chen.github.io/Reason3D/

关键词

引用

@article{arxiv.2405.19326,
  title  = {Reasoning3D -- Grounding and Reasoning in 3D: Fine-Grained Zero-Shot Open-Vocabulary 3D Reasoning Part Segmentation via Large Vision-Language Models},
  author = {Tianrun Chen and Chunan Yu and Jing Li and Jianqi Zhang and Lanyun Zhu and Deyi Ji and Yong Zhang and Ying Zang and Zejian Li and Lingyun Sun},
  journal= {arXiv preprint arXiv:2405.19326},
  year   = {2024}
}