中文

瑞典百科全书的内容追踪、链接与分析

计算与语言 2026-05-05 v1

摘要

对旧百科全书的数字化是提高获取历史结构知识的重要步骤。然而,这一过程往往仅限于光学字符识别,未充分利用其底层结构。此外,许多百科全书包含多个版本,反映知识的演变。原始文本缺乏结构,使得在这些版本之间跟踪变更变得困难。本文构建了一个管道以恢复文本结构:提取标题词并识别条目;对实体进行分类;跨版本匹配条目;并将条目链接到 Wikidata 项目。我们将该管道应用于《北欧家族百科全书》(Nordisk familjebok)的四个主要版本,该百科全书于 1876 年至 1951 年间发布。我们以 97.8% 的 F1 分数提取标题词,以 93.4% 的 F1 分数实现标题词分类。在小规模评估中,我们在跨版本匹配上达到 93% 的精确率,在 Wikidata 链接上达到 85% 的精确率和 16.5% 的召回率。这表明针对数字化历史知识的自动化方法是可行的。这将有助于保存通用知识并理解知识的传播。数据集和程序已在线上公开。

关键词

引用

@article{arxiv.2605.02466,
  title  = {ATLAS: Article Tracking, Linking, and Analysis of Swedish Encyclopedias},
  author = {Albin Andersson and Salam Jonasson and Fredrik Wastring and Pierre Nugues},
  journal= {arXiv preprint arXiv:2605.02466},
  year   = {2026}
}

备注

11 pages, 5 figures