BERTifying 僧伽罗语——预训练语言模型用于僧伽罗语文本分类的综合分析
计算与语言
2022-08-18 v2
摘要
本研究首次对预训练语言模型用于僧伽罗语文本分类的性能进行了综合分析。我们在一组不同的僧伽罗语文本分类任务上测试,分析表明,在包含僧伽罗语的多语言预训练模型(XLM-R、LaBSE 与 LASER)中,XLM-R 迄今为止是僧伽罗语文本分类的最佳模型。我们还预训练了两个基于 RoBERTa 的单语僧伽罗语模型,其远优于现有的僧伽罗语预训练语言模型。我们展示,经微调后,这些预训练语言模型为僧伽罗语文本分类设定了极强的基线,并在标注数据不足以微调时具有鲁棒性。我们进一步给出了使用预训练模型进行僧伽罗语文本分类的一组建议。我们还引入了有助于未来僧伽罗语文本分类研究的新标注数据集,并公开发布了我们的预训练模型。
引用
@article{arxiv.2208.07864,
title = {BERTifying Sinhala -- A Comprehensive Analysis of Pre-trained Language Models for Sinhala Text Classification},
author = {Vinura Dhananjaya and Piyumal Demotte and Surangika Ranathunga and Sanath Jayasena},
journal= {arXiv preprint arXiv:2208.07864},
year = {2022}
}