SpatialPrompting:基于关键帧的零样本三维空间推理方法
计算机视觉与模式识别
2025-05-09 v1 人工智能
计算与语言
摘要
本研究介绍了SpatialPrompting,这是一种新型框架,利用无需训练的多模态大语言模型的涌现推理能力,实现对三维(3D)环境中的零样本空间推理。不同于依赖昂贵的3D专用微调和特殊3D输入(如点云或体素特征)的现有方法,SpatialPrompting采用关键帧驱动的提示生成策略。该框架使用视觉语言相似性、马哈拉威距离、场域视野和图像锐度等指标,从图像序列中选择多样且信息丰富的关键帧,然后将其与相应的相机姿态数据集成,以有效抽象空间关系并推断复杂的3D结构。该方法不仅建立了一种利用直观视觉和位置线索进行灵活空间推理的新范式,还在多个基准数据集上实现了最先进的零样本性能,包括ScanQA和SQA3D。该方法有效消除了对特殊3D输入和微调的需求,提供了一种更简单且更可扩展的替代方案。
引用
@article{arxiv.2505.04911,
title = {SpatialPrompting: Keyframe-driven Zero-Shot Spatial Reasoning with Off-the-Shelf Multimodal Large Language Models},
author = {Shun Taguchi and Hideki Deguchi and Takumi Hamazaki and Hiroyuki Sakai},
journal= {arXiv preprint arXiv:2505.04911},
year = {2025}
}
备注
18 pages, 11 figures