中文

SpatialPIN:通过提示与交互式3D先验提升视觉语言模型的空间推理能力

计算机视觉与模式识别 2024-10-31 v5

摘要

当前领先的空间推理增强型视觉语言模型(VLM)在空间视觉问答(VQA)方面表现卓越。然而,我们认为,更高层次的3D感知任务(如 articulating dynamic scene changes 和 motion planning),需要超越当前空间VQA数据集的根本性且显式的3D理解能力。本文提出SpatialPIN——一个通过提示(prompting)与交互式(interacting)方式,利用多个3D基础模型的先验信息,以零样本、无训练的方式提升VLM空间推理能力的框架。大量实验表明,具备空间推理能力的VLM在各种形式的空间VQA任务上表现良好,并且可扩展至各种下游机器人任务,如抓取与堆叠、轨迹规划等。

关键词

引用

@article{arxiv.2403.13438,
  title  = {SpatialPIN: Enhancing Spatial Reasoning Capabilities of Vision-Language Models through Prompting and Interacting 3D Priors},
  author = {Chenyang Ma and Kai Lu and Ta-Ying Cheng and Niki Trigoni and Andrew Markham},
  journal= {arXiv preprint arXiv:2403.13438},
  year   = {2024}
}

备注

NeurIPS 2024; Project Page: https://dannymcy.github.io/zeroshot_task_hallucination/