BanglaBERT:孟加拉语低资源语言理解评测的预训练语言模型与基准
计算与语言
2022-05-11 v4
摘要
本文介绍BanglaBERT,一种基于BERT的自然语言理解(NLU)模型,在孟加拉语上进行了预训练;孟加拉语在NLP文献中是一种广泛使用但资源匮乏的语言。为预训练BanglaBERT,我们通过爬取110个热门孟加拉语站点收集了27.5 GB的孟加拉语预训练数据(称为“Bangla2B+”)。我们引入了自然语言推理与问答两个下游任务数据集,并在涵盖文本分类、序列标注与片段预测的四项多样化NLU任务上进行基准测试。在此过程中,我们将它们纳入首个孟加拉语语言理解基准(BLUB)。BanglaBERT取得了最先进的结果,优于多语言与单语言模型。我们已在 https://github.com/csebuetnlp/banglabert 公开模型、数据集与排行榜,以推进孟加拉语NLP发展。
引用
@article{arxiv.2101.00204,
title = {BanglaBERT: Language Model Pretraining and Benchmarks for Low-Resource Language Understanding Evaluation in Bangla},
author = {Abhik Bhattacharjee and Tahmid Hasan and Wasi Uddin Ahmad and Kazi Samin and Md Saiful Islam and Anindya Iqbal and M. Sohel Rahman and Rifat Shahriyar},
journal= {arXiv preprint arXiv:2101.00204},
year = {2022}
}
备注
Findings of North American Chapter of the Association for Computational Linguistics, NAACL 2022 (camera-ready)