改进低资源菲律宾语的大规模语言模型与资源
计算与语言
2021-11-12 v1
摘要
在本文中,我们通过两种方式改进现有的低资源菲律宾语语言资源。首先,我们概述了TLUnified数据集的构建,这是一个大规模预训练语料库,在规模和主题多样性方面优于该语言现有的较小预训练数据集。其次,我们遵循RoBERTa预训练技术预训练了新的Transformer语言模型,以取代使用小语料库训练的现有模型。我们的新RoBERTa模型在三个基准数据集上相比现有菲律宾语模型展现出显著改进,在三个不同难度的分类任务中平均测试准确率提升4.47%。
引用
@article{arxiv.2111.06053,
title = {Improving Large-scale Language Models and Resources for Filipino},
author = {Jan Christian Blaise Cruz and Charibeth Cheng},
journal= {arXiv preprint arXiv:2111.06053},
year = {2021}
}
备注
Resources are available at blaisecruz.com/resources