中文

大语言模型眼中的世界:探究 LLM 在表示地理特征中的可靠性

计算机与社会 2025-06-03 v1 人工智能 信息检索

摘要

随着大语言模型 (LLM) 的不断发展,其在提供事实信息方面的可信度问题变得日益重要。这一担忧同样适用于其准确表示地理世界的能力。鉴于该领域的最新进展,探讨 LLM 对地理世界的表示能在多大程度上被信任是很有必要的。本研究评估了 GPT-4o 和 Gemini 2.0 Flash 在三项关键地理空间任务中的表现:地理编码、高程估计和逆地理编码。在地理编码任务中,两个模型在估计奥地利因斯布鲁克圣安妮柱的坐标时均表现出系统性误差和随机误差,其中 GPT-4o 的偏差更大,而 Gemini 2.0 Flash 表现出更高的精度但存在显著的系统性偏移。在高程估计任务中,两个模型均倾向于低估奥地利各地的海拔,尽管它们捕捉到了整体的地形趋势,且 Gemini 2.0 Flash 在东部地区表现更好。逆地理编码任务要求根据坐标识别奥地利联邦州,结果显示 Gemini 2.0 Flash 在总体准确率和 F1 分数上均优于 GPT-4o,展现出更好的跨区域一致性。尽管有上述发现,两个模型均未能准确重建奥地利的联邦州,凸显了持续存在的误分类问题。研究得出结论,尽管 LLM 能够近似地理信息,但其准确性和可靠性并不一致,这凸显了利用地理信息进行微调以增强其在 GIScience 与地理信息学中实用性的必要性。

关键词

引用

@article{arxiv.2506.00203,
  title  = {The World As Large Language Models See It: Exploring the reliability of LLMs in representing geographical features},
  author = {Omid Reza Abbasi and Franz Welscher and Georg Weinberger and Johannes Scholz},
  journal= {arXiv preprint arXiv:2506.00203},
  year   = {2025}
}

备注

9 pages, 4 figures, 2 tables