SpatialPIN:通过提示与交互式3D先验提升视觉语言模型的空间推理能力
计算机视觉与模式识别
2024-10-31 v5
摘要
当前领先的空间推理增强型视觉语言模型(VLM)在空间视觉问答(VQA)方面表现卓越。然而,我们认为,更高层次的3D感知任务(如 articulating dynamic scene changes 和 motion planning),需要超越当前空间VQA数据集的根本性且显式的3D理解能力。本文提出SpatialPIN——一个通过提示(prompting)与交互式(interacting)方式,利用多个3D基础模型的先验信息,以零样本、无训练的方式提升VLM空间推理能力的框架。大量实验表明,具备空间推理能力的VLM在各种形式的空间VQA任务上表现良好,并且可扩展至各种下游机器人任务,如抓取与堆叠、轨迹规划等。
引用
@article{arxiv.2403.13438,
title = {SpatialPIN: Enhancing Spatial Reasoning Capabilities of Vision-Language Models through Prompting and Interacting 3D Priors},
author = {Chenyang Ma and Kai Lu and Ta-Ying Cheng and Niki Trigoni and Andrew Markham},
journal= {arXiv preprint arXiv:2403.13438},
year = {2024}
}
备注
NeurIPS 2024; Project Page: https://dannymcy.github.io/zeroshot_task_hallucination/