塔塔尔斯坦地名:面向地理空间问答的双语数据集与混合RAG系统
计算与语言
2026-05-08 v1
摘要
本文解决了对多语言地名数据进行自动地理空间问答的问题。引入了塔塔尔斯坦共和国地名的原创双语数据集,包含9,688条结构化记录,涵盖语言、词源、行政和坐标信息(93.1%已坐标化)。基于此数据集,我们构建了约39,000个问-上下文-答案三元组的问答语料,确保答案定位。混合检索器集成了密集语义索引(multilingual-e5-large)与基于KD树和哈弗赛urin距离的地理空间过滤。针对500个测试查询,混合搜索实现Recall@1=0.988,Recall@5=1.000,MRR=0.994,显著优于BM25和纯空间方法。在测试的阅读器架构(RuBERT、XLM-RoBERTa-large、T5-RUS)中,XLM-RoBERTa-large取得最佳质量:EM=0.992,F1=0.994。在原始输出上,RuBERT模型在坐标问题中失效(F1=0),而XLM-RoBERTa-large达到F1=0.984;但简单后处理消除数值间隙,使RuBERT准确率恢复至100%。此差异源于分词差异和预训练语料库组成。所有资源(数据集、QA语料、模型权重、web演示)均已在Hugging Face上公开。结果适用于地理空间问答服务、地理编码和多语言地区的数字人文。
引用
@article{arxiv.2605.05962,
title = {Tatarstan Toponyms: A Bilingual Dataset and Hybrid RAG System for Geospatial Question Answering},
author = {Mullosharaf K. Arabov},
journal= {arXiv preprint arXiv:2605.05962},
year = {2026}
}
备注
Preprint