重新评估大型语言模型关于基数方向推理能力
计算与语言
2025-11-11 v2
摘要
我们探讨了 28 个大型语言模型(LLM)关于基数方向(cardinal directions, CDs)推理能力。我们基于一组模板生成了基准测试,广泛测试了 LLM 确定特定情景下正确 CD 的能力。这些模板允许出现多种变体,如行动方式(agent 的运动方式)以及情景置于第一、第二或第三人称。即使是最新的大型推理模型,也无法可靠地确定所有问题的正确 CD。本文概述并扩展了之前在 COSIT-24 上 presenting 的工作。
引用
@article{arxiv.2507.12059,
title = {Evaluating the Ability of Large Language Models to Reason about Cardinal Directions, Revisited},
author = {Anthony G Cohn and Robert E Blackwell},
journal= {arXiv preprint arXiv:2507.12059},
year = {2025}
}
备注
8 pages, 5 figures. Accepted at QR 2025 : 38th International Workshop on Qualitative Reasoning at IJCAI. arXiv admin note: substantial text overlap with arXiv:2406.16528