中文

学习绘制 ASCII 图形提升语言模型的空间推理能力

人工智能 2026-04-17 v1

摘要

当面对复杂的空间问题时,人类天然倾向于绘制布局以组织思维,绘制本身也进一步锐化了对空间问题的理解。在本研究中,我们提出类似的原则是否同样适用于大语言模型(LLM):通过学习从空间描述中构建显式的视觉布局,能否为 LLM 带来真正的空间理解能力?我们引入 Text2Space 数据集,将自然语言描述与真实的 ASCII 网格布局以及空间 QA 对偶配对,使我们能够将表示构建过程的错误与对其进行推理的错误区分开来。我们采用 ASCII 格式,因为它具有人类可读性,完全在语言模型的 token 空间内工作,并以结构可验证的方式编码空间关系。我们的评估结果显示,LLM 在解读 ASCII 表示方面表现突出,但在从文本中生成它们方面困难重重,这些构建错误会向下游错误答案传播。为此,我们在布局构建(Text→ASCII)上训练模型,发现这显著提升了仅凭文本的空间推理能力,即使在推理时不生成任何 ASCII 也能带来显著提升。将构建与理解训练相结合进一步放大了这些收益。关键的是,这些改进会转移到三个外部空间推理基准测试中,表明就像草图能够锐化人类的空间思维一样,学习构建显式布局能够为空间理解能力带来可迁移的提升。

关键词

引用

@article{arxiv.2604.14641,
  title  = {Learning to Draw ASCII Improves Spatial Reasoning in Language Models},
  author = {Shiyuan Huang and Li Liu and Jincheng He and Leilani H. Gilpin},
  journal= {arXiv preprint arXiv:2604.14641},
  year   = {2026}
}