中文

AfroLM:基于自主动学习的面向23种非洲语言的多语言预训练语言模型

计算与语言 2023-04-06 v2 人工智能 机器学习

摘要

近年来,多语言预训练语言模型因在众多下游自然语言处理(NLP)任务上的卓越表现而受到重视。然而,预训练这些大型多语言语言模型需要大量训练数据,而非洲语言并不具备这样的数据。主动学习是一种半监督学习算法,其中模型持续且动态地学习识别最有益于自身训练的样本,以在下游任务上实现更好的优化与性能。此外,主动学习有效且切实地解决了现实世界中的数据稀缺问题。尽管有诸多益处,主动学习在NLP尤其是多语言语言模型预训练背景下却很少受到关注。本文提出AfroLM,一种使用我们新颖的自主动学习框架从零开始在23种非洲语言(迄今最大规模努力)上预训练的多语言语言模型。AfroLM在比现有基线小得多(14倍)的数据集上预训练,在各种NLP下游任务(NER、文本分类和情感分析)上优于许多多语言预训练语言模型(AfriBERTa、XLMR-base、mBERT)。额外的域外情感分析实验表明,AfroLM能够很好地跨各种领域泛化。我们在 https://github.com/bonaventuredossou/MLM_AL 发布了源代码及我们框架中使用的数据集。

关键词

引用

@article{arxiv.2211.03263,
  title  = {AfroLM: A Self-Active Learning-based Multilingual Pretrained Language Model for 23 African Languages},
  author = {Bonaventure F. P. Dossou and Atnafu Lambebo Tonja and Oreen Yousuf and Salomey Osei and Abigail Oppong and Iyanuoluwa Shode and Oluwabusayo Olufunke Awoyomi and Chris Chinenye Emezue},
  journal= {arXiv preprint arXiv:2211.03263},
  year   = {2023}
}

备注

Third Workshop on Simple and Efficient Natural Language Processing, EMNLP 2022