中文

通过数据增强改进波斯语关系抽取模型

计算与语言 2022-03-30 v1

摘要

关系抽取是预测句子或文档中实体间语义关系类型的任务,是自然语言处理中的一项重要任务。尽管针对英语已有大量研究和数据集,波斯语却缺乏充分的研究和全面的数据集。该任务唯一可用的波斯语数据集是PERLEX,其为SemEval-2010-Task-8数据集的波斯语专家翻译版本。本文中,我们呈现了所增强的数据集以及我们的系统在NSURL 2021研讨会波斯语关系抽取共享任务中的结果与发现。我们使用PERLEX作为基础数据集,并通过应用一些文本预处理步骤以及借助数据增强技术增加其规模来改进它,以提升所应用模型的泛化性和鲁棒性。然后我们采用包括ParsBERT和多语言BERT在内的两种不同模型在增强的PERLEX数据集上进行关系抽取。我们的最佳模型在比赛测试阶段取得64.67%的Macro-F1,并在PERLEX测试集上达到83.68%的Macro-F1。

关键词

引用

@article{arxiv.2203.15323,
  title  = {Improving Persian Relation Extraction Models by Data Augmentation},
  author = {Moein Salimi Sartakhti and Romina Etezadi and Mehrnoush Shamsfard},
  journal= {arXiv preprint arXiv:2203.15323},
  year   = {2022}
}

备注

5 pages, 6 images