NaijaNER:面向 5 种尼日利亚语言的全面命名实体识别
计算与语言
2021-05-04 v1
摘要
命名实体识别(NER)最常见的应用集中于英语及其他高可用语言。本工作中,我们展示了关于 5 种尼日利亚语言(尼日利亚英语、尼日利亚皮钦英语、伊博语、约鲁巴语和豪萨语)的命名实体识别研究结果。这些语言被视为低资源语言,其中大多数鲜有公开可用的自然语言处理工作。本工作中,我们训练了各自的 NER 模型并记录了每种语言的指标。我们还构建了一个组合模型,可处理五种语言中任意一种的命名实体识别(NER)。该组合模型在每种语言的 NER 上表现良好,且优于专门在该语言标注数据上训练的独立 NER 模型。本工作的目的在于分享我们利用命名实体识别优化所列尼日利亚语言信息提取的经验,以促进包容性、便于生产部署及模型复用。本项目开发的模型已发布于 GitHub https://git.io/JY0kk,交互式网页应用见 https://nigner.herokuapp.com/。
引用
@article{arxiv.2105.00810,
title = {NaijaNER : Comprehensive Named Entity Recognition for 5 Nigerian Languages},
author = {Wuraola Fisayo Oyewusi and Olubayo Adekanmbi and Ifeoma Okoh and Vitus Onuigwe and Mary Idera Salami and Opeyemi Osakuade and Sharon Ibejih and Usman Abdullahi Musa},
journal= {arXiv preprint arXiv:2105.00810},
year = {2021}
}
备注
Accepted at the AfricaNLP Workshop, EACL 2021