中文

面向三种低资源语言(博杰普尔语、迈蒂利语和马加伊语)的数据集与深度学习基线命名实体识别器开发

计算与语言 2020-09-15 v1

摘要

在自然语言处理(NLP)流水线中,命名实体识别(NER)是初步问题之一,其标注专有名词及其他命名实体,如地点、人物、组织、疾病等。若无 NER 模块,此类实体会对机器翻译系统的性能产生不利影响。NER 通过单独识别并处理此类实体来帮助克服该问题,尽管它也可用于信息抽取系统。博杰普尔语、迈蒂利语和马加伊语是低资源语言,通常被称为普尔瓦查尔语言。本文聚焦于通过标注其可用语料库的部分内容,为旨在将这些语言翻译为印地语的机器翻译系统开发 NER 基准数据集。分别大小为 228373、157468 和 56190 个词符的博杰普尔语、迈蒂利语和马加伊语语料库,使用 22 个实体标签进行了标注。该标注考虑了粗粒度标注标签,并沿用其中一个印地语 NER 数据集所用的标签集。我们还报告了一个使用 LSTM-CNNs-CRF 模型的基于深度学习的基线。使用条件随机场模型从 NER 工具获得的较低基线 F1 分数分别为:博杰普尔语 96.73、迈蒂利语 93.33、马加伊语 95.04。基于深度学习的技法(LSTM-CNNs-CRF)取得了:博杰普尔语 96.25、迈蒂利语 93.33、马加伊语 95.44。

关键词

引用

@article{arxiv.2009.06451,
  title  = {Development of a Dataset and a Deep Learning Baseline Named Entity Recognizer for Three Low Resource Languages: Bhojpuri, Maithili and Magahi},
  author = {Rajesh Kumar Mundotiya and Shantanu Kumar and Ajeet kumar and Umesh Chandra Chaudhary and Supriya Chauhan and Swasti Mishra and Praveen Gatla and Anil Kumar Singh},
  journal= {arXiv preprint arXiv:2009.06451},
  year   = {2020}
}

备注

34 pages; 7 figures