中文

LocationReasoner:在真实场景选址推理中评估大语言模型

人工智能 2026-04-02 v3

摘要

近期大语言模型(LLM)的进展,特别是通过强化后训练增强的模型(如OpenAI o1和DeepSeek-R1),展示了令人印象深刻的推理能力。然而,这些能力主要在数学问题求解和代码生成等领域进行基准测试,由此留下了一个问题:此类推理技能是否能泛化到复杂的真实场景。在本文中,我们引入了LocationReasoner,一个用于评估LLM在真实场景选址中推理能力的基准,模型必须通过推理多样化的、复杂的空间、环境和物流约束来识别可行位置。该基准覆盖了精心设计的、难度各异的查询,并得到支持约束驱动选址搜索的沙箱环境支撑。自动化验证进一步保证了基准的可扩展性,支持任意数量查询的添加。利用来自波士顿、纽约和坦帕的真实选址数据进行的大量评估表明,最先进的推理模型在真实场景中相对于其非推理前身仅提供了有限的改进,即使最新的OpenAI o4模型也在30%的选址任务上失败。此外,ReAct和Reflexion等智能体策略往往遭受过度推理,导致比直接提示更差的结果。在揭示了LLM在整体和非线性推理方面的关键局限性后,我们发布了LocationReasoner,以促进开发能够在真实世界决策任务中进行稳健、有依据推理的LLM和智能体。我们的基准代码和数据可在https://github.com/miho-koda/LocationReasoner获取。

关键词

引用

@article{arxiv.2506.13841,
  title  = {LocationReasoner: Evaluating LLMs on Real-World Site Selection Reasoning},
  author = {Miho Koda and Yu Zheng and Ruixian Ma and Mingyang Sun and Devesh Pansare and Fabio Duarte and Paolo Santi},
  journal= {arXiv preprint arXiv:2506.13841},
  year   = {2026}
}

备注

ICLR 2026 Workshop on Efficient Spatial Reasoning