DziriBERT:面向阿尔及利亚方言的预训练语言模型
计算与语言
2022-12-13 v3 机器学习
摘要
鉴于预训练 transformer 在许多任务和语言上取得的先进结果,它们已成为自然语言处理中事实上的标准模型。然而,当前大多数模型都是在已有大量文本资源可用的语言(如英语、法语、阿拉伯语等)上训练的。因此,仍有许多低资源语言需要学界更多的关注。在本文中,我们研究阿尔及利亚方言,其若干特性使得使用阿拉伯语或多语言模型并不合适。为解决此问题,我们收集了超过一百万条阿尔及利亚推文,并预训练了首个阿尔及利亚语言模型:DziriBERT。与现有模型相比,DziriBERT 取得了更好的结果,尤其是在处理罗马字母文本时。所得结果表明,在一个小数据集(150 MB)上预训练专用模型可以胜过在更大量数据(数百 GB)上训练的现有模型。最后,我们的模型已公开供学界使用。
引用
@article{arxiv.2109.12346,
title = {DziriBERT: a Pre-trained Language Model for the Algerian Dialect},
author = {Amine Abdaoui and Mohamed Berrimi and Mourad Oussalah and Abdelouahab Moussaoui},
journal= {arXiv preprint arXiv:2109.12346},
year = {2022}
}
备注
4 Pages