基于检索增强生成的地名起源识别
信息检索
2025-09-04 v2
摘要
墨尔本“蝙蝠侠街”背后的“蝙蝠侠”是谁?理解地名背后的历史、文化和社会叙事,可以揭示塑造一个社区的丰富背景。尽管地名在地名录中作为重要的空间参考,但它们通常缺乏关于地名起源的信息。在当今的地名录中丰富这些地名是一个耗时的手动过程,需要广泛探索大量的文档和文本来源档案。自然语言处理和语言模型(LM)的最新进展,因其利用所存储文档语义的强大能力,为地名起源识别的显著自动化带来了希望。本章介绍了一个检索增强生成流水线,旨在通过广泛的知识库 DBpedia 搜索地名起源。给定一个空间查询,我们的方法首先提取可能包含与查询相关知识的子图;然后对提取的子图进行排序,使用微调的基于语言模型的模型(即 ColBERTv2 和 Llama2)生成查询的最终答案。我们的结果突显了自动检索地名起源所面临的关键挑战,特别是语言模型倾向于未充分利用文本中包含的空间信息作为判别因素。我们的方法也为使用检索增强生成进行地理信息检索的更广泛影响构建了框架。
引用
@article{arxiv.2509.01030,
title = {Identifying Origins of Place Names via Retrieval Augmented Generation},
author = {Alexis Horde-Vo and Matt Duckham and Estrid He and Rafe Benli},
journal= {arXiv preprint arXiv:2509.01030},
year = {2025}
}