中文

RED$^{\rm FM}$:一个经过过滤的多语言关系抽取数据集

计算与语言 2023-06-21 v2

摘要

关系抽取(RE)是一项识别文本中实体间关系的任务,可实现关系事实的获取并弥合自然语言与结构化知识之间的鸿沟。然而,当前的RE模型通常依赖于覆盖关系类型少的小型数据集,尤其是在处理英语以外的语言时。在本文中,我们解决上述问题并提供两种新资源,以支持多语言RE系统的训练与评估。首先,我们提出SREDFM^{\rm FM},一个自动标注的数据集,覆盖18种语言、400种关系类型、13种实体类型,总计超过4000万三元组实例。其次,我们提出REDFM^{\rm FM},一个更小的人工修订数据集,用于七种语言,可对多语言RE系统进行评估。为展示这些新数据集的效用,我们使用首个端到端多语言RE模型mREBEL进行实验,该模型可抽取多种语言中的三元组(包括实体类型)。我们在https://www.github.com/babelscape/rebel发布我们的资源与模型检查点。

关键词

引用

@article{arxiv.2306.09802,
  title  = {RED$^{\rm FM}$: a Filtered and Multilingual Relation Extraction Dataset},
  author = {Pere-Lluís Huguet Cabot and Simone Tedeschi and Axel-Cyrille Ngonga Ngomo and Roberto Navigli},
  journal= {arXiv preprint arXiv:2306.09802},
  year   = {2023}
}

备注

ACL 2023. Please cite authors correctly using both lastnames ("Huguet Cabot", "Ngonga Ngomo")