利用大语言模型对复杂相对局部描述进行地理参考
人工智能
2026-01-26 v1
摘要
地理参考文本文档通常依赖基于地名的典型方法来分配地理坐标,或依赖于将文本术语与地理位置关联的语言建模方法。然而,许多位置描述是通过空间关系相对指定位置的,这使得仅基于地名或地理指示词进行地理编码不够准确。这一问题在生物标本收集记录中经常出现,由于该记录的年龄往往早于 GPS,位置常通过叙述性描述而非坐标来指定。准确的地理参考对于生物多样性研究至关重要,但该过程仍然依赖大量人工工作,导致对自动化地理参考解决方案的需求。本文探讨了利用大语言模型(LLM)自动对复杂局部描述进行地理参考的潜力,重点关注生物多样性收藏领域。我们首先识别了有效的提示模式,然后使用量化低秩适应(QLoRA)在来自多个地区和语言的生物多样性数据集上微调了 LLM。我们的做法在给定训练数据量下优于现有基线,平均情况下 65% 的记录位于 10 km 半径内,最佳结果(纽约州)为 85% 位于 10km 内,67% 位于 1km 内。选定的 LLM 对 lengthy、复杂描述表现良好,凸显了其在地理参考复杂局部描述方面的潜力。
引用
@article{arxiv.2512.14228,
title = {Georeferencing complex relative locality descriptions with large language models},
author = {Aneesha Fernando and Surangika Ranathunga and Kristin Stock and Raj Prasanna and Christopher B. Jones},
journal= {arXiv preprint arXiv:2512.14228},
year = {2026}
}
备注
Provisionally accepted for publication in the International Journal of Geographical Information Science