中文

MaiBERT:面向低资源马提利语的预训练语料库与语言模型

计算与语言 2026-02-03 v3

摘要

低资源语言的自然语言理解(NLU)仍然是自然语言处理领域的一个重大挑战,由于高质量数据和语言特定模型的匮乏。马提利语尽管被数百万人使用,但缺乏足够的计算资源,限制了其在数字和人工智能驱动应用中的纳入。为解决这一差距,我们引入了 maiBERT,一个专门针对马提利语使用掩码语言建模(MLM)技术预训练的基于 BERT 的语言模型。我们的模型在新构建的马提利语语料库上训练,并通过新闻分类任务进行评估。在实验中,maiBERT 达到了 87.02% 的准确率,优于 NepBERTa 和 HindiBERT 等现有区域模型,整体准确率提升 0.13%,各类别提升 5-7%。我们已在 Hugging Face 上开源了 maiBERT,使其可用于下游任务(如情感分析和命名实体识别(NER))的进一步微调。

关键词

引用

@article{arxiv.2509.15048,
  title  = {MaiBERT: A Pre-training Corpus and Language Model for Low-Resourced Maithili Language},
  author = {Sumit Yadav and Raju Kumar Yadav and Utsav Maskey and Gautam Siddharth Kashyap and Ganesh Gautam and Usman Naseem},
  journal= {arXiv preprint arXiv:2509.15048},
  year   = {2026}
}

备注

Accepted at EACL LoResLM 2026