中文

MultiTACRED:TAC 关系抽取数据集的多语言版本

计算与语言 2023-05-16 v2

摘要

关系抽取(RE)是信息抽取中的一项基本任务,其在多语言场景下的扩展一直受到缺乏与大型英语数据集(如 TACRED (Zhang et al., 2017))规模相当的有监督资源的阻碍。为弥补这一缺口,我们引入了 MultiTACRED 数据集,涵盖来自 9 个语系的 12 种类型学上多样的语言,该数据集通过机器翻译 TACRED 实例并自动投影其实体标注而创建。我们分析了翻译与标注投影质量,识别了错误类别,并在常见迁移学习场景下对微调的预训练单语与多语言语言模型进行了实验评估。我们的分析表明,机器翻译是迁移 RE 实例的可行策略,母语使用者判定超过 83% 的翻译实例在语言与语义上可接受。我们发现许多目标语言的单语 RE 模型性能与英语原版相当,且在英语与目标语言数据组合上训练的多语言模型可以优于其单语对应模型。然而,我们也观察到多种翻译与标注投影错误,既源于 MT 系统,也源于目标语言的语言特征(如代词脱落、复合与屈折),这些降低了数据集质量与 RE 模型性能。

关键词

引用

@article{arxiv.2305.04582,
  title  = {MultiTACRED: A Multilingual Version of the TAC Relation Extraction Dataset},
  author = {Leonhard Hennig and Philippe Thomas and Sebastian Möller},
  journal= {arXiv preprint arXiv:2305.04582},
  year   = {2023}
}

备注

Accepted at ACL 2023