历史地理坐标注释数据集 EDDA-Coordinata
计算与语言
2026-03-02 v1 数字图书馆
信息检索
摘要
本文介绍了一个来自狄德罗和阿勒伯特八eenth-century 版《百科全书》的地理坐标数据集。从历史文本中自动恢复地理坐标是一项复杂任务,因为它们以各种方式表达且精度各异。为提高从类似的早期现代文本中检索坐标的能力,我们创建了金标准数据集,训练了模型,发布了推断和规范化后的坐标数据,并尝试将这些模型应用于新文本。从 ARTFL 和 ENCCRE 的每个版本中共 74,000 篇文章中,我们检查了 15,278 个地理条目,手动识别出 4,798 个包含坐标的条目,以及 10,480 个包含描述性但非数值参考的条目。利用我们的金标准注释,我们训练了基于 transformer 的模型来检索和规范化坐标。本文介绍的管道组合了一个用于识别坐标条目的数据分类器和第二个模型进行检索,分别测试了 encoder-decoder 和 decoder 架构。交叉验证得出 86% 的 EM 分数。在对域外的八eenth century Trevoux 词典(同样为法语)上,微调后的模型得分 61%;对于十九世纪第 7 版《Britannica 百科全书》(英文),EM 为 77%。这些发现突显了金标准数据集作为训练数据的有用性,以及我们两种步骤方法在跨语言、跨域的通用性。
关键词
引用
@article{arxiv.2602.23941,
title = {EDDA-Coordinata: An Annotated Dataset of Historical Geographic Coordinates},
author = {Ludovic Moncla and Pierre Nugues and Thierry Joliveau and Katherine McDonough},
journal= {arXiv preprint arXiv:2602.23941},
year = {2026}
}
备注
Accepted at LREC 2026