大语言模型在空间方位判断中的扭曲现象
计算与语言
2024-06-05 v2
摘要
我们提出了一个基准测试,用于评估大语言模型(LLMs)辨别地理位置间半基本方位的能力,并将其应用于三个主流大语言模型:GPT-3.5、GPT-4 和 Llama-2。该基准测试专门评估大语言模型是否表现出类似于人类的层级空间偏差,即对单个地点空间关系的判断会受到其所属更大群体感知关系的影响。为探究这一点,我们设计了 14 个聚焦于美国知名城市的问题。其中 7 个问题旨在用可能受州或国家等更大地理单元方位影响的场景来挑战大语言模型,而其余 7 个目标地点则不易受到此类层级分类的影响。在测试的模型中,GPT-4 表现最优,准确率达到 55%,其次是 GPT-3.5 的 47% 和 Llama-2 的 45%。这些模型在疑似存在层级偏差的任务上准确率显著下降。例如,GPT-4 在这些任务上的准确率降至 33%,而在其他任务上则为 86%。然而,模型在大多数情况下能识别出最近的基本方位,这反映了其联想学习机制,从而体现了类似人类的错误认知。我们讨论了提升大语言模型空间推理能力的途径。
引用
@article{arxiv.2401.04218,
title = {Distortions in Judged Spatial Relations in Large Language Models},
author = {Nir Fulman and Abdulkadir Memduhoğlu and Alexander Zipf},
journal= {arXiv preprint arXiv:2401.04218},
year = {2024}
}
备注
This manuscript has been accepted for publication in The Professional Geographer