PuoBERTa:面向茨瓦纳语的精选语言模型的训练与评估
计算与语言
2023-10-25 v2
摘要
自然语言处理(NLP)在英语等资源丰富语言上已取得显著进展,但在茨瓦纳语等低资源语言上仍相对滞后。本文通过提出 PuoBERTa——一个专为茨瓦纳语定制的掩码语言模型——来填补这一空白。我们阐述了如何收集、整理并预处理多样化的单语文本,以生成供 PuoBERTa 训练的高质量语料。在既往茨瓦纳语单语资源构建工作的基础上,我们在多项 NLP 任务上评估了 PuoBERTa,包括词性(POS)标注、命名实体识别(NER)与新闻分类。此外,我们引入了一个新的茨瓦纳语新闻分类数据集,并给出了使用 PuoBERTa 的初步基准。我们的工作证明了 PuoBERTa 在提升茨瓦纳语等研究不足语言的 NLP 能力方面的有效性,并为未来研究方向铺平了道路。
引用
@article{arxiv.2310.09141,
title = {PuoBERTa: Training and evaluation of a curated language model for Setswana},
author = {Vukosi Marivate and Moseli Mots'Oehli and Valencia Wagner and Richard Lastrucci and Isheanesu Dzingirai},
journal= {arXiv preprint arXiv:2310.09141},
year = {2023}
}
备注
Accepted for SACAIR 2023