使用小型 Sepedi 数据集为基于 Transformer 的生成模型预训练
计算与语言
2025-01-28 v1 人工智能
机器学习
摘要
由于低资源语言的数据稀缺,开发这些语言的语言模型进展缓慢。当前,预训练语言模型在自然语言处理领域已广受欢迎,尤其是在为低资源语言开发特定领域模型方面。在本研究中,我们实验了使用基于遮挡的技术在训练语言模型进行文本生成任务时的影响。我们 curate 了 2 个新数据集:Sepedi 单语 (SepMono) 数据集来自多个南非资源,以及 Sepedi 收音新闻 (SepNews) 数据集来自收音新闻领域。我们使用 SepMono 数据集通过遮挡和非遮挡预训练技术为基于 Transformer 的模型进行预训练,并进行性能比较。SepNews 数据集专用于 fine-tuning。我们的结果表明,采用非遮挡模型在衡量验证损失和 perplexity 时的表现优于遮挡模型。然而,分析生成文本的 BLEU 分数(衡量生成文本质量的指标)显示,遮挡模型的 BLEU 分数略高于非遮挡模型。
引用
@article{arxiv.2501.15281,
title = {Pre-training a Transformer-Based Generative Model Using a Small Sepedi Dataset},
author = {Simon P. Ramalepe and Thipe I. Modipa and Marelie H. Davel},
journal= {arXiv preprint arXiv:2501.15281},
year = {2025}
}