尼泊尔语预训练变换器模型的开发
计算与语言
2025-08-20 v2 机器学习
摘要
变换器架构的预训练语言模型在自然语言处理(NLP)领域已主导相当一段时间。然而,约有3200万人使用的尼泊尔语在此领域仍显著缺乏代表性。这种不足主要归因于单语数据语料的稀缺以及为尼泊尔语提供的资源有限。虽然已有工作主要集中在基础编码器模型,但在解码器架构的探索方面仍存在显著空白。为填补这一空白,我们收集了27.5 GB的尼泊尔语文本数据,约为此前任何可获得的尼泊尔语语料库的2.4倍。利用这一数据,我们为尼泊尔语预训练了三种不同模型,即BERT、RoBERTa和GPT-2。此外,我们进行了指令调优,探讨了其在单一尼泊尔语数据上的潜力,为未来研究奠定了基础。我们的模型在尼泊尔语基准测试中(Nep-gLUE)取得了95.60分,比现有最佳模型提升了2分,也在文本生成任务中超越了现有模型,显示出在理解和生成尼泊尔语文本方面的提升。
引用
@article{arxiv.2411.15734,
title = {Development of Pre-Trained Transformer-based Models for the Nepali Language},
author = {Prajwal Thapa and Jinu Nyachhyon and Mridul Sharma and Bal Krishna Bal},
journal= {arXiv preprint arXiv:2411.15734},
year = {2025}
}