中文

L3Cube-MahaCorpus 与 MahaBERT:马拉地语单语语料库、马拉地语 BERT 语言模型及资源

计算与语言 2022-03-15 v2 机器学习

摘要

我们呈现 L3Cube-MahaCorpus,一个从不同的互联网来源抓取的马拉地语单语数据集。我们将现有的马拉地语单语语料库扩充了 24.8M 个句子和 289M 个词元。我们进一步呈现基于 BERT 的掩码语言模型 MahaBERT、MahaAlBERT 和 MahaRoBerta,以及基于完整马拉地语语料库(含 752M 词元)训练的 fast text 词嵌入 MahaFT。我们展示了这些资源在下游马拉地语情感分析、文本分类和命名实体识别(NER)任务上的有效性。我们还发布了 MahaGPT,一个在马拉地语语料库上训练的生成式马拉地语 GPT 模型。马拉地语是印度一种流行语言,但仍缺乏这些资源。本工作是构建马拉地语开放资源的一步。数据和模型可在 https://github.com/l3cube-pune/MarathiNLP 获取。

关键词

引用

@article{arxiv.2202.01159,
  title  = {L3Cube-MahaCorpus and MahaBERT: Marathi Monolingual Corpus, Marathi BERT Language Models, and Resources},
  author = {Raviraj Joshi},
  journal= {arXiv preprint arXiv:2202.01159},
  year   = {2022}
}