L3Cube-MahaCorpus 与 MahaBERT:马拉地语单语语料库、马拉地语 BERT 语言模型及资源
计算与语言
2022-03-15 v2 机器学习
摘要
我们呈现 L3Cube-MahaCorpus,一个从不同的互联网来源抓取的马拉地语单语数据集。我们将现有的马拉地语单语语料库扩充了 24.8M 个句子和 289M 个词元。我们进一步呈现基于 BERT 的掩码语言模型 MahaBERT、MahaAlBERT 和 MahaRoBerta,以及基于完整马拉地语语料库(含 752M 词元)训练的 fast text 词嵌入 MahaFT。我们展示了这些资源在下游马拉地语情感分析、文本分类和命名实体识别(NER)任务上的有效性。我们还发布了 MahaGPT,一个在马拉地语语料库上训练的生成式马拉地语 GPT 模型。马拉地语是印度一种流行语言,但仍缺乏这些资源。本工作是构建马拉地语开放资源的一步。数据和模型可在 https://github.com/l3cube-pune/MarathiNLP 获取。
引用
@article{arxiv.2202.01159,
title = {L3Cube-MahaCorpus and MahaBERT: Marathi Monolingual Corpus, Marathi BERT Language Models, and Resources},
author = {Raviraj Joshi},
journal= {arXiv preprint arXiv:2202.01159},
year = {2022}
}