中文

改进低资源菲律宾语的大规模语言模型与资源

计算与语言 2021-11-12 v1

摘要

在本文中,我们通过两种方式改进现有的低资源菲律宾语语言资源。首先,我们概述了TLUnified数据集的构建,这是一个大规模预训练语料库,在规模和主题多样性方面优于该语言现有的较小预训练数据集。其次,我们遵循RoBERTa预训练技术预训练了新的Transformer语言模型,以取代使用小语料库训练的现有模型。我们的新RoBERTa模型在三个基准数据集上相比现有菲律宾语模型展现出显著改进,在三个不同难度的分类任务中平均测试准确率提升4.47%。

关键词

引用

@article{arxiv.2111.06053,
  title  = {Improving Large-scale Language Models and Resources for Filipino},
  author = {Jan Christian Blaise Cruz and Charibeth Cheng},
  journal= {arXiv preprint arXiv:2111.06053},
  year   = {2021}
}

备注

Resources are available at blaisecruz.com/resources