中文

3DAxisPrompt:提升 GPT-4o 中的 3D 定位与推理能力

计算机视觉与模式识别 2025-03-18 v1 人工智能

摘要

多模态大型语言模型在多种任务中展现出了令人瞩目的能力,尤其是在配备了精心设计的视觉提示时。然而,现有研究主要侧重于逻辑推理和视觉理解,而 MLLM 在 3D 视觉中有效运作的能力仍是一个持续探索的领域。在本文中,我们引入了一种名为 3DAxisPrompt 的新型视觉提示方法,以激发 MLLM 在真实场景中的 3D 理解能力。更具体地说,我们的方法利用 3D 坐标轴和由 Segment Anything Model (SAM) 生成的掩码,向 MLLM 提供显式的几何先验,然后将其令人印象深刻的 2D 定位和推理能力扩展到真实世界的 3D 场景中。此外,我们首先对潜在的视觉提示格式进行了全面调查,并总结了我们的发现,以揭示 GPT-4o(作为 MLLM 的代表)在 3D 理解能力方面的潜力与局限。最后,我们使用四个数据集构建了评估环境,即 ScanRefer、ScanNet、FMB 和 nuScene 数据集,涵盖了各种 3D 任务。基于此,我们进行了大量的定量和定性实验,证明了所提出方法的有效性。总体而言,我们的研究表明,在 3DAxisPrompt 的帮助下,MLLM 能够有效地感知物体在真实场景中的 3D 位置。然而,单一的提示工程方法并不能在所有 3D 任务中始终取得最佳结果。本研究强调了利用提示工程技术使 MLLM 进行 3D 视觉定位/推理的可行性。

关键词

引用

@article{arxiv.2503.13185,
  title  = {3DAxisPrompt: Promoting the 3D Grounding and Reasoning in GPT-4o},
  author = {Dingning Liu and Cheng Wang and Peng Gao and Renrui Zhang and Xinzhu Ma and Yuan Meng and Zhihui Wang},
  journal= {arXiv preprint arXiv:2503.13185},
  year   = {2025}
}