中文

L3Cube-MahaNER:一个马拉地语命名实体识别数据集与BERT模型

计算与语言 2022-04-14 v1 机器学习

摘要

命名实体识别(NER)是一项基础 NLP 任务,在对话与搜索系统中有主要应用。它帮助我们识别句子中用于下游应用的关键实体。面向流行语言的 NER 或类似槽填充系统已在商业应用中被广泛使用。在本工作中,我们关注印度语言马拉地语,该语言主要由马哈拉施特拉邦人民使用。马拉地语是一种低资源语言,仍缺乏有用的 NER 资源。我们提出 L3Cube-MahaNER,这是第一个主要的马拉地语黄金标准命名实体识别数据集。我们也描述了过程中遵循的人工标注指南。最后,我们在不同的 CNN、LSTM 以及基于 Transformer 的模型(如 mBERT、XLM-RoBERTa、IndicBERT、MahaBERT 等)上对该数据集进行基准测试。MahaBERT 在所有模型中提供最佳性能。数据与模型可在 https://github.com/l3cube-pune/MarathiNLP 获取。

关键词

引用

@article{arxiv.2204.06029,
  title  = {L3Cube-MahaNER: A Marathi Named Entity Recognition Dataset and BERT models},
  author = {Parth Patil and Aparna Ranade and Maithili Sabane and Onkar Litake and Raviraj Joshi},
  journal= {arXiv preprint arXiv:2204.06029},
  year   = {2022}
}