L3Cube-HindBERT 与 DevBERT:面向基于天城文印地语和马拉地语的预训练 BERT Transformer 模型
计算与语言
2023-01-10 v4 机器学习
摘要
模型中心当前可用的单语印地语 BERT 模型在下游任务上的表现并不优于多语模型。我们提出 L3Cube-HindBERT,一个在印地语单语语料上预训练的印地语 BERT 模型。此外,由于印度语言印地语和马拉地语共享天城文(Devanagari)文字,我们为这两种语言训练了一个单一模型。我们发布 DevBERT,一个在马拉地语和印地语单语数据集上训练的天城文 BERT 模型。我们在下游印地语和马拉地语文本分类与命名实体识别任务上对这些模型进行了评估。基于 HindBERT 和 DevBERT 的模型相比多语 MuRIL、IndicBERT 和 XLM-R 显示出显著改进。基于这些观察,我们还发布了其他印度语言坎纳达语、泰卢固语、马拉雅拉姆语、泰米尔语、古吉拉特语、阿萨姆语、奥里亚语、孟加拉语和旁遮普语的单语 BERT 模型。这些模型发布于 https://huggingface.co/l3cube-pune 。
引用
@article{arxiv.2211.11418,
title = {L3Cube-HindBERT and DevBERT: Pre-Trained BERT Transformer models for Devanagari based Hindi and Marathi Languages},
author = {Raviraj Joshi},
journal= {arXiv preprint arXiv:2211.11418},
year = {2023}
}
备注
Accepted at ICICC 2023