中文

面向尼泊尔语言大语言模型:基于尼泊尔 BPE 分词器的高效 GPT 训练

计算与语言 2025-12-17 v1 人工智能

摘要

尼泊尔语是一种由超过 3200 万人口使用的低资源语言,由于其复杂的语法、屈折性 morphology 以及高质量语料的稀缺,持续面临自然语言处理 (NLP) 的挑战。目前大多数研究集中于基础编码器架构,对尼泊尔语专属的文本生成效果仍不足。本研究提出一种基于 GPT-2 的尼泊尔语言模型,通过受 GPT-3 启发的多项训练策略实现,包括优化学习率计划、批量扩展和架构细化。我们训练了一个专为尼泊尔文本训练的 16k 字节配对编码 (BPE) 分词器,以确保更一致的分词和改进的输入表示。该模型在由 10.75GB 清理后的尼泊尔 BERT 语料库和额外网页抓取的尼泊尔新闻文章组成的组合数据集上进行预训练。集成 FlashAttention 以减少内存占用并稳定训练。经过两个 epoch后,模型训练损失为 3.168177,验证损失为 3.081982,最终困惑度为 21.80,表明其能够生成连贯的尼泊尔新闻风格文本的能力。

关键词

引用

@article{arxiv.2512.14585,
  title  = {Towards Nepali-language LLMs: Efficient GPT training with a Nepali BPE tokenizer},
  author = {Adarsha Shrestha and Basanta Pokharel and Binit Shrestha and Smriti Adhikari and Dinesh Gothe},
  journal= {arXiv preprint arXiv:2512.14585},
  year   = {2025}
}

备注

Work in progress