Biographical:一个半监督关系抽取数据集
信息检索
2022-05-03 v1
摘要
从在线文档中抽取传记信息是关于信息抽取(IE)界的一个热门研究话题。各种自然语言处理(NLP)技术,如文本分类、文本摘要和关系抽取,常被用于实现此目的。在这些技术中,RE 最为常见,因为它可直接用于构建传记知识图谱。RE 通常被视为一个监督式机器学习(ML)问题,其中 ML 模型在标注数据集上训练。然而,由于标注过程可能昂贵且耗时,用于 RE 的标注数据集很少。为此,我们开发了 Biographical,首个用于 RE 的半监督数据集。该数据集面向数字人文(DH)与历史研究,通过将对齐自 Wikipedia 文章的句子与来自包括 Pantheon 和 Wikidata 等来源的匹配结构化数据自动编译而成。通过利用 Wikipedia 文章的结构与鲁棒的命名实体识别(NER),我们以相对较高精度匹配信息,从而为 DH 领域中重要的十种不同关系编译标注关系对。此外,我们通过训练一个当前最优神经模型对关系对分类,并在手动标注的黄金标准集上评估,展示了该数据集的有效性。Biographical 主要旨在为数字人文与历史领域内 RE 训练神经模型,但正如我们在文末讨论的,它也可用于其他目的。
引用
@article{arxiv.2205.00806,
title = {Biographical: A Semi-Supervised Relation Extraction Dataset},
author = {Alistair Plum and Tharindu Ranasinghe and Spencer Jones and Constantin Orasan and Ruslan Mitkov},
journal= {arXiv preprint arXiv:2205.00806},
year = {2022}
}
备注
Accepted to ACM SIGIR 2022