See&Trek:面向多模态大语言模型的无训练空间提示
计算机视觉与模式识别
2025-09-22 v1 人工智能
摘要
我们引入了 SEE&TREK,这是首个专为在纯视觉约束下增强多模态大语言模型(MLLM)空间理解而量身定制的无训练提示框架。尽管先前的努力已经纳入了深度或点云等模态来改善空间推理,但纯粹的视觉空间理解仍未得到充分探索。SEE&TREK 通过关注两个核心原则来解决这一空白:增加视觉多样性和运动重建。对于视觉多样性,我们执行最大语义丰富度采样,该采样使用现成的感知模型来提取捕获场景结构的语义丰富关键帧。对于运动重建,我们模拟视觉轨迹并将相对空间位置编码到关键帧中,以同时保持空间关系和时间连贯性。我们的方法无需训练且无需 GPU,仅需单次前向传播,即可无缝集成到现有的 MLLM 中。在 VSI-BENCH 和 STI-BENCH 上的大量实验表明,SEE&TREK 在各种空间推理任务中持续提升各种 MLLM 的性能,最高提升 +3.5%,为更强的空间智能提供了有希望的路径。
引用
@article{arxiv.2509.16087,
title = {See&Trek: Training-Free Spatial Prompting for Multimodal Large Language Model},
author = {Pengteng Li and Pinhao Song and Wuyang Li and Weiyu Guo and Huizai Yao and Yijie Xu and Dugang Liu and Hui Xiong},
journal= {arXiv preprint arXiv:2509.16087},
year = {2025}
}
备注
Accepted by NeurIPS 2025