中文

LaoPLM:老挝语预训练语言模型

计算与语言 2021-10-15 v3

摘要

预训练语言模型(PLM)在大型语料上训练,可捕获上下文中不同层次的概念,从而生成通用语言表示。它们可惠及多个下游自然语言处理(NLP)任务。尽管PTM已广泛用于大多数NLP应用,尤其是英语等高资源语言,但在老挝语NLP研究中仍代表性不足。以往老挝语相关工作受限于标注数据集的缺乏与语言资源的稀疏。本工作中,我们构建了一个文本分类数据集以缓解老挝语资源匮乏的状况。我们还提出了首个基于transformer的老挝语PTM,包含四个版本:BERT-small、BERT-base、ELECTRA-small和ELECTRA-base,并在两个下游任务——词性标注与文本分类上进行了评估。实验证明了我们的老挝语模型的有效性。我们将向社区发布我们的模型与数据集,希望促进老挝语NLP应用的未来发展。

关键词

引用

@article{arxiv.2110.05896,
  title  = {LaoPLM: Pre-trained Language Models for Lao},
  author = {Nankai Lin and Yingwen Fu and Chuwei Chen and Ziyu Yang and Shengyi Jiang},
  journal= {arXiv preprint arXiv:2110.05896},
  year   = {2021}
}