面向殖民时期弗吉尼亚土地授权地理定位的大语言模型基准评测
机器学习
2026-02-10 v2 人工智能
计算与语言
计算机视觉与模式识别
信息检索
摘要
弗吉尼亚州十七、十八世纪的土地专利主要以叙述性的界址描述形式留存,限制了空间分析。本研究系统评估了当前一代大语言模型(LLMs)在聚焦评估情境下,将这些散文摘要转换为地理上准确的经纬度坐标的能力。我们发布了一个包含 5,471 份弗吉尼亚专利摘要(1695–1732 年)的数字化语料库,其中 43 个经过严格验证的测试案例作为初始的、聚焦地理的基准。六种跨三种架构(o 系列、GPT-4 级和 GPT-3.5)的 OpenAI 模型在两种范式下进行了测试:直接生成坐标和调用外部地理编码 API 的工具增强思维链。结果与 GIS 分析师基线、Stanford NER 地理分析器、Mordecai-3 神经地理分析器以及县中心启发式方法进行了比较。表现最佳的单次调用模型 o3-2025-04-16 实现了 23 公里的平均误差(中位数 14 公里),比中位数 LLM(37.4 公里)性能提升 37.5%,比最弱 LLM(50.3 公里)提升 53.5%,比外部基线(GIS 分析师)提升 67%,比 Stanford NER 提升 70%。五次调用集成进一步将误差降低至 19.2 公里(中位数 12.2 公里),且额外成本极低(每份授权约 0.20 美元),比中位数 LLM 性能提升 48.7%。一项专利权人姓名消融实验略微增加了误差(约 7%),表明模型依赖于文本中的地标和邻接描述而非记忆。高性价比的 gpt-4o-2024-08-06 模型在每千份授权 1.09 美元的成本下保持了 28 公里的平均误差,建立了一个强有力的成本-精度基准。在此评估中,外部地理编码工具未提供可测量的益处。这些发现展示了大语言模型在可扩展、准确且高性价比的历史地理配准方面的潜力。
引用
@article{arxiv.2508.08266,
title = {Benchmarking Large Language Models for Geolocating Colonial Virginia Land Grants},
author = {Ryan Mioduski},
journal= {arXiv preprint arXiv:2508.08266},
year = {2026}
}