中文

FoREST:空间推理任务中的参考框架评估

计算与语言 2025-11-25 v3

摘要

空间推理是人类智能的一个基本方面。空间认知的一个关键概念是参考框架(Frame of Reference),用于识别空间表达的视角。尽管其重要性不言而喻,但在需要空间智能的 AI 模型中,参考框架(FoR)受到的关注有限。缺乏针对该领域的专门基准测试和对大型语言模型(LLM)深入评估。为此,我们引入了空间推理任务中的参考框架评估(FoREST)基准,旨在评估 LLM 中的 FoR 理解。我们对 LLM 进行评估,以回答需要 FoR 理解的问题,并使用 FoREST 对文本到图像模型进行布局生成。我们的结果揭示了不同 FoR 类别在各种 LLM 中的表现差异,影响其生成文本到图像生成准确布局的能力。这一发现凸显了 FoR 理解的关键短comings。为提高 FoR 理解,我们提出了空间引导式提示(Spatial-Guided prompting),可提高 LLM 提取关键空间概念的能力。我们的方法在空间推理任务中整体性能得到提升。

关键词

引用

@article{arxiv.2502.17775,
  title  = {FoREST: Frame of Reference Evaluation in Spatial Reasoning Tasks},
  author = {Tanawan Premsri and Parisa Kordjamshidi},
  journal= {arXiv preprint arXiv:2502.17775},
  year   = {2025}
}

备注

10 pages, 3 Figures, 4 Tables, EMNLP-2025 Main (Oral)