中文

mahaNLP:一个马拉地语自然语言处理库

计算与语言 2023-11-07 v1 机器学习

摘要

我们提出 mahaNLP,一个专为马拉地语构建的开源自然语言处理(NLP)库。它旨在增强低资源印度语言马拉地语在 NLP 领域的支持。它是一个易于使用、可扩展且模块化的马拉地语文本分析工具包,构建于最先进的基于 MahaBERT 的 transformer 模型之上。我们的工作具有重要意义,因为其他现有的 Indic NLP 库仅提供基础的马拉地语处理支持,并依赖性能受限的旧模型。我们的工具包因提供全面的 NLP 任务阵列而脱颖而出,涵盖基础预处理任务以及情感分析、NER、仇恨言论检测和句子补全等高级 NLP 任务。本文聚焦于 mahaNLP 框架的概述、其特征及用法。本工作是 L3Cube MahaNLP 计划的一部分,更多信息可在 https://github.com/l3cube-pune/MarathiNLP 获取。

关键词

引用

@article{arxiv.2311.02579,
  title  = {mahaNLP: A Marathi Natural Language Processing Library},
  author = {Vidula Magdum and Omkar Dhekane and Sharayu Hiwarkhedkar and Saloni Mittal and Raviraj Joshi},
  journal= {arXiv preprint arXiv:2311.02579},
  year   = {2023}
}

备注

Accepted at IJCNLP-AACL 2023