中文

面向历史文本的对比式实体指代消歧

计算与语言 2024-06-25 v1 综合经济学 经济学

摘要

大规模历史文献集合对社会科学研究至关重要。尽管 digitization 水平不断提升,这些文档通常缺乏用于指代文本中提到的个人的唯一性跨文档标识符,以及来自外部知识库(如 Wikipedia/Wikidata)的个人标识符。现有的实体消歧方法在历史文献上准确率往往不足,因为这些文献中大量个体在当代知识库中并不被记载。本研究在三个方面改进跨文档指代消解和消歧以适应历史文本:1) 构建大规模训练数据集,包含大量困难负样本——从 Wikipedia 上下文和消歧页面中提取超过 1.9 亿个实体对;2) 来自手工标注历史新闻稿的高质量评估数据;3) 在该历史基准上评估的训练模型。我们对比式训练双编码器模型,用于在历史文本中指代消解和消歧个人,实现了准确、可扩展的性能,能够识别知识库之外的个体。我们的做法在历史新闻稿基准上显著超越了其他实体消歧模型。我们的模型在现代实体消歧基准上也表现出竞争力,尤其是某些新闻消歧数据集。

关键词

引用

@article{arxiv.2406.15576,
  title  = {Contrastive Entity Coreference and Disambiguation for Historical Texts},
  author = {Abhishek Arora and Emily Silcock and Leander Heldring and Melissa Dell},
  journal= {arXiv preprint arXiv:2406.15576},
  year   = {2024}
}