24小时环游世界:探测大语言模型对时间与地点的知识
计算与语言
2025-06-05 v1
摘要
对时间与空间的推理对于理解我们的世界至关重要。然而,语言模型在这一领域的能力尚未得到充分探索,因为先前的工作要么孤立地测试其在时间或空间方面的逻辑推理能力,要么仅在简单或人工环境中进行测试。在本文中,我们首次评估了语言模型同时对时间和空间进行联合推理的能力。为实现我们的分析,我们创建了 GeoTemp,一个包含 320k 条提示的数据集,覆盖 289 个城市、217 个国家和 37 个时区。利用 GeoTemp,我们评估了三个不同模型家族的八款开放聊天模型在时间和地理知识不同组合下的表现。我们发现,大多数模型在仅涉及时间知识的推理任务上表现良好,且整体性能随规模提升而提高。然而,在需要连接时间和地理信息的任务中,性能仍然受限。我们未发现性能与特定地理区域之间存在明显相关性。相反,我们发现对于模型困惑度较低的地名,性能显著提升,这表明它们在模型训练期间被反复出现。我们进一步证明,其性能受到提示构建方式的严重影响——直接注入地理知识会带来性能提升,而令人惊讶的是,像思维链提示这样的技术在简单任务上反而会降低性能。
引用
@article{arxiv.2506.03984,
title = {Around the World in 24 Hours: Probing LLM Knowledge of Time and Place},
author = {Carolin Holtermann and Paul Röttger and Anne Lauscher},
journal= {arXiv preprint arXiv:2506.03984},
year = {2025}
}