中文

针对尼泊尔语言中基于 BERT 的句子级主题分类基准测试

计算与语言 2026-03-02 v1 机器学习

摘要

Transformer 模型如 BERT 已在众多语言范围内显著推动了自然语言处理 (NLP) 的发展。然而,尼泊尔语是一种使用梵文脚本的低资源语言,仍相对不被探索。本研究对比评估了多语言、印度、印地语和尼泊尔 BERT 变体在尼泊尔主题分类中的效果。对十个预训练模型 (包括 mBERT、XLM-R、MuRIL、DevBERT、HindiBERT、IndicBERT 和 NepBERTa) 进行微调测试,数据集包含 25,006 句话,涵盖五个概念领域。使用准确率、加权精确率、召回率、F1 分数和 AUROC 指标进行评估。结果显示,尼特模型尤其是 MuRIL-large 取得了 90.60% 的最高 F1 分数,超越了多语言和单语言模型。NepBERTa 也取得了相当竞争的 88.26% 的 F1 分数。总体而言,这些发现为未来的文档级分类和更广泛的尼泊尔 NLP 应用奠定了稳健的基准。

关键词

引用

@article{arxiv.2602.23940,
  title  = {Benchmarking BERT-based Models for Sentence-level Topic Classification in Nepali Language},
  author = {Nischal Karki and Bipesh Subedi and Prakash Poudyal and Rupak Raj Ghimire and Bal Krishna Bal},
  journal= {arXiv preprint arXiv:2602.23940},
  year   = {2026}
}

备注

5 pages, 2 figures. Accepted and presented at the Regional International Conference on Natural Language Processing (RegICON 2025), Gauhati University, Guwahati, India, November 27-29, 2025. To appear in the conference proceedings. Accepted papers list available at: https://www.regicon2025.in/accepted-papers