网格空间理解:面向网格、具身环境与坐标结构的文本空间推理数据集
计算与语言
2026-03-19 v1
摘要
我们引入 GSU,一个仅包含文本的网格数据集,用于评估大语言模型在网格上的空间推理能力,涵盖 3 项核心任务:导航、对象定位和结构组合。通过摒弃视觉输入,孤立空间推理与感知分离,我们发现虽然大多数模型掌握基本网格概念,但在相对具身主体的参考系以及从坐标列表识别 3D 形状方面仍感到困难。我们也发现视觉模态的暴露并不提供一种可泛化的 3D 空间理解,VLMs 能够利用的这种理解在这些任务中并不适用。最后,我们表明虽然最新的前沿模型能够解决所提供的任务(尽管更难的变体仍可能使其困惑),但完全对小型语言模型进行微调或对小型 LLM 进行 LORA 微调显示出潜力可匹配前沿模型性能,为开发专门的具身智能体提供了这一途径。
引用
@article{arxiv.2603.17333,
title = {Grid Spatial Understanding: A Dataset for Textual Spatial Reasoning over Grids, Embodied Settings, and Coordinate Structures},
author = {Risham Sidhu and Julia Hockenmaier},
journal= {arXiv preprint arXiv:2603.17333},
year = {2026}
}
备注
preprint