中文

KyrgyzBERT:面向突破部族语NLP的紧凑高效语言模型

计算与语言 2025-11-26 v1

摘要

突破部族语(Kyrgyz)是一种资源有限的语言,缺乏基础NLP工具。为填补这一空白,我们介绍KyrgyzBERT,这是首个可公开获取的单语BERT基语言模型,专为该语言设计。模型包含3590万参数,采用专为该语言形态结构设计的自定义词元化器。为评估性能,我们构建了kyrgyz-sst2,一个由翻译Stanford情感树库并手动标注完整测试集的情感分析基准数据集。KyrgyzBERT在该数据集上微调后 achieves 0.8280的F1分数,与五倍参数量的微调mBERT模型相当。所有模型、数据和代码均已公开,以支持突破部族语NLP领域的后续研究。

关键词

引用

@article{arxiv.2511.20182,
  title  = {KyrgyzBERT: A Compact, Efficient Language Model for Kyrgyz NLP},
  author = {Adilet Metinov and Gulida M. Kudakeeva and Gulnara D. Kabaeva},
  journal= {arXiv preprint arXiv:2511.20182},
  year   = {2025}
}

备注

3 pages, 1 figure, 2 tables. Preprint