中文

L3Cube-MahaNLP:马拉地语自然语言处理数据集、模型与库

计算与语言 2022-06-01 v2 机器学习

摘要

尽管马拉地语是印度第三大流行语言,该语言仍缺乏有用的 NLP 资源。此外,流行的 NLP 库均不支持马拉地语。通过 L3Cube-MahaNLP,我们旨在构建马拉地语自然语言处理的资源与库。我们提出了用于情感分析、命名实体识别和仇恨言论检测等监督任务的数据集与 transformer 模型。我们还发布了一个用于无监督语言建模任务的单语马拉地语语料库。总体而言,我们提出了 MahaCorpus、MahaSent、MahaNER 和 MahaHate 数据集及其在相应数据集上微调的 MahaBERT 模型。我们旨在超越基准数据集,为马拉地语准备实用资源。相关资源可在 https://github.com/l3cube-pune/MarathiNLP 获取。

关键词

引用

@article{arxiv.2205.14728,
  title  = {L3Cube-MahaNLP: Marathi Natural Language Processing Datasets, Models, and Library},
  author = {Raviraj Joshi},
  journal= {arXiv preprint arXiv:2205.14728},
  year   = {2022}
}