RUBERT:一种使用跨语言迁移学习的双语罗马乌尔都语BERT
计算与语言
2021-02-24 v1
摘要
在近期研究中已表明,多语言语言模型的表现不及其单语对应模型。同时众所周知,为每种语言训练和维护单语模型是一个昂贵且耗时的过程。罗马乌尔都语是一种资源匮乏的语言,在社交媒体平台和聊天应用中被广泛使用。在本研究中,我们提出了一个由爬取的推文组成的新数据集,包含5400万词符和300万句子。此外,我们还提出了RUBERT,一个通过对英语BERT进行额外预训练创建的双语罗马乌尔都语模型。我们将其性能与从头训练的单语罗马乌尔都语BERT以及通过对多语言BERT进行额外预训练创建的多语言罗马乌尔都语BERT进行比较。我们通过实验表明,对英语BERT进行额外预训练带来了最显著的性能提升。
引用
@article{arxiv.2102.11278,
title = {RUBERT: A Bilingual Roman Urdu BERT Using Cross Lingual Transfer Learning},
author = {Usama Khalid and Mirza Omer Beg and Muhammad Umair Arshad},
journal= {arXiv preprint arXiv:2102.11278},
year = {2021}
}
备注
arXiv admin note: substantial text overlap with arXiv:2102.10958