LocalBench:针对县级地方知识与推理对大语言模型进行基准测试
计算与语言
2025-11-19 v2 人工智能
计算机与社会
摘要
大语言模型 (LLM) 已在宏观尺度地理任务上广泛评估,包括全球事实回忆、事件概述和区域推理。然而,其处理超细粒度知识的能力仍不被充分理解。这种差距日益重要,因为从公民平台到社区新闻等实际应用都需要能够针对社区特定动态、文化叙事和地方治理进行推理的 AI 系统。现有基准测试未能捕捉这种复杂性,往往依赖粗糙的数据或孤立的参考。我们提出 LocalBench,是第一个系统性地评估 LLM 在美国全国 526 个县(涵盖 49 个州)县级地方知识的基准。基于 Localness 概念框架,LocalBench 包含 14,782 对经验证的问答对,整合了人口普查统计、地方 subreddit 讨论和区域新闻等多样化来源,涵盖 locality 的物理、认知和关系三个维度。使用 LocalBench,我们在封闭书籍和 web 增强设置下评估了 13 个最先进的 LLM。我们的发现揭示了关键局限性:即使是表现最好的模型在叙事式问题上也仅达到 56.8% 的准确率,在数值推理方面表现不足 15.5%。此外,模型规模和 web 增强并不必然导致更好的表现,例如搜索可使 Gemini 的准确率提高 13.6%,但会降低 GPT 系列模型的表现 -11.4%。这些结果凸显了迫切需要能够支持平等、地方导向 AI 系统的语言模型的需求:能够在地理和文化语境中处理社区的多样性、细粒度现实。
引用
@article{arxiv.2511.10459,
title = {LocalBench: Benchmarking LLMs on County-Level Local Knowledge and Reasoning},
author = {Zihan Gao and Yifei Xu and Jacob Thebault-Spieker},
journal= {arXiv preprint arXiv:2511.10459},
year = {2025}
}