中文

面向多语言关系抽取数据的引导式远程监督:适应一门新语言

计算与语言 2024-03-28 v2 机器学习

摘要

关系抽取对于在数字人文及相关学科背景下提取和理解传记信息至关重要。社区中对于构建能够训练机器学习模型以提取关系的数据集的兴趣日益增长。然而,标注此类数据集可能昂贵且耗时,此外还仅限于英语。本文应用引导式远程监督来创建一个大型的德语传记关系抽取数据集。我们的数据集由针对九种关系类型的超过 80,000 个实例组成,是最大的传记性德语关系抽取数据集。我们还创建了一个包含 2000 个实例的人工标注数据集用于评估模型,并将其与使用引导式远程监督编译的数据集一同发布。我们在自动创建的数据集上训练了多个最先进的机器学习模型,并将它们一并发布。此外,我们还进行了可能有益于许多低资源语言的多语言和跨语言实验。

关键词

引用

@article{arxiv.2403.17143,
  title  = {Guided Distant Supervision for Multilingual Relation Extraction Data: Adapting to a New Language},
  author = {Alistair Plum and Tharindu Ranasinghe and Christoph Purschke},
  journal= {arXiv preprint arXiv:2403.17143},
  year   = {2024}
}

备注

Accepted to LREC-COLING 2024 (The 2024 Joint International Conference on Computational Linguistics, Language Resources and Evaluation)