中文

LAST:利用工具提示增强多模态大语言模型的空间推理

计算机视觉与模式识别 2026-04-14 v1 人工智能

摘要

空间推理是智能系统 perceive and interact with physical world 所必不可少的能力。然而,多模态大语言模型(MLLMs)在解析复杂几何布局时经常出现幻觉和不准确的问题。随着数据驱动的规模化难以内化结构化的几何先验和空间约束,集成成熟的专业视觉模型已成为具有吸引力的替代方案。尽管该方法前景光明,但在空间推理领域应用受到两个关键挑战的制约:调用异构且参数丰富工具的困难,以及理解和有效利用其多样化低层输出(例如分割掩码、深度图)进行高层推理的挑战。为此,我们提出了 LAST—a 一个用于工具增强空间推理的统一框架。LAST features 一个可扩展的交互式沙盒,称为 LAST-Box,将异构工具调用抽象为原子指令和可重用的空间技能, 返回包含多模态提示(例如带注释的图像和文本描述)的输出,这些提示可以直接被 LLMs 消耗。我们进一步设计了一个三阶段的渐进式训练策略,引导模型从理解工具输出到熟练和自适应地调用工具。实验表明,LAST-7B 在四个数据集上实现约 20% 的性能提升,超越其 backbone 模型,并优于强大的专有闭源 LLMs,显著增强了对复杂空间任务的推理能力。

关键词

引用

@article{arxiv.2604.09712,
  title  = {LAST: Leveraging Tools as Hints to Enhance Spatial Reasoning for Multimodal Large Language Models},
  author = {Shi-Yu Tian and Zhi Zhou and Kun-Yang Yu and Ming Yang and Yang Chen and Ziqiao Shang and Lan-Zhe Guo and Yu-Feng Li},
  journal= {arXiv preprint arXiv:2604.09712},
  year   = {2026}
}

备注

13 pages