中文

重新评估大型语言模型关于基数方向推理能力

计算与语言 2025-11-11 v2

摘要

我们探讨了 28 个大型语言模型(LLM)关于基数方向(cardinal directions, CDs)推理能力。我们基于一组模板生成了基准测试,广泛测试了 LLM 确定特定情景下正确 CD 的能力。这些模板允许出现多种变体,如行动方式(agent 的运动方式)以及情景置于第一、第二或第三人称。即使是最新的大型推理模型,也无法可靠地确定所有问题的正确 CD。本文概述并扩展了之前在 COSIT-24 上 presenting 的工作。

关键词

引用

@article{arxiv.2507.12059,
  title  = {Evaluating the Ability of Large Language Models to Reason about Cardinal Directions, Revisited},
  author = {Anthony G Cohn and Robert E Blackwell},
  journal= {arXiv preprint arXiv:2507.12059},
  year   = {2025}
}

备注

8 pages, 5 figures. Accepted at QR 2025 : 38th International Workshop on Qualitative Reasoning at IJCAI. arXiv admin note: substantial text overlap with arXiv:2406.16528