中文

PERLEX:用于关系抽取的双语波斯语-英语黄金数据集

计算与语言 2020-05-15 v1

摘要

关系抽取是从句子中的实体间抽取语义关系的任务。它是信息抽取、知识抽取与知识库填充等若干自然语言处理任务的核心组成部分。本研究的主要动机源于波斯语关系抽取数据集的缺失,以及从日益增长的波斯语大数据中为不同应用抽取知识的必要性。本文提出“PERLEX”作为首个波斯语关系抽取数据集,其为“Semeval-2010-Task-8”数据集的专家翻译版本。此外,本文利用最先进的与语言无关的算法处理波斯语关系抽取。我们在所提双语数据集上采用六种不同模型进行关系抽取,包括一个非神经模型(作为基线)、三个神经模型,以及两个由 multilingual-BERT 上下文词表示馈入的深度学习模型。实验取得了最大 f-score 77.66%(由 BERTEM-MTB 方法给出),作为波斯语关系抽取的最先进水平。

关键词

引用

@article{arxiv.2005.06588,
  title  = {PERLEX: A Bilingual Persian-English Gold Dataset for Relation Extraction},
  author = {Majid Asgari-Bidhendi and Mehrdad Nasser and Behrooz Janfada and Behrouz Minaei-Bidgoli},
  journal= {arXiv preprint arXiv:2005.06588},
  year   = {2020}
}