中文

ScanReason:通过推理能力增强 3D 视觉 grounding

计算机视觉与模式识别 2024-07-18 v3 人工智能 计算与语言

摘要

尽管在 3D 视觉 grounding 方面取得了显著进展,但当前模型仍依赖于明确的文本描述进行 grounding,且缺乏从隐式指令中推理人类意图的能力。我们提出了一种新任务称为 3D reasoning grounding,并引入了新的基准 ScanReason,该基准包含来自五种推理类型的 10K+ question-answer-location 三元组,需要推理与 grounding 的融合。我们进一步设计了我们的方法 ReGround3D,由受多模态大型语言模型(MLLM)赋能的视觉中心推理模块和 3D grounding 模块组成,通过回顾 3D 场景中增强的几何和细粒度细节来获得准确的对象位置。提出一种链式 grounding 机制,以在推理和 grounding 之间交替进行来进一步提升性能。对所提出的基准进行大量实验验证了我们方法的有效性。

关键词

引用

@article{arxiv.2407.01525,
  title  = {ScanReason: Empowering 3D Visual Grounding with Reasoning Capabilities},
  author = {Chenming Zhu and Tai Wang and Wenwei Zhang and Kai Chen and Xihui Liu},
  journal= {arXiv preprint arXiv:2407.01525},
  year   = {2024}
}

备注

Accepted by ECCV 2024. A comprehensive and hierarchical 3D reasoning grounding benchmark in the era of foundation models. Project page: https://zcmax.github.io/projects/ScanReason