中文

低资源语言宗卡语分词算法的对比分析

计算与语言 2025-09-22 v1

摘要

大型语言模型(LLM)正日益普及并快速改进。分词器是自然语言处理的关键组件,尤其对LLM至关重要。分词器将输入文本拆分为模型可高效处理的标记,同时确保文本被准确表示,捕捉其含义与结构。有效的分词器通过提升模型对上下文与语义的理解来增强LLM的能力,最终改善翻译、分类、情感分析和文本生成等下游任务的表现。大多数预训练分词器适用于英语等高资源语言,但在低资源语言上表现不佳。宗卡语是不丹的国家语言,约有七十万使用者,属于低资源语言,其语言复杂性带来了独特的NLP挑战。尽管已取得一些进展,但宗卡语NLP领域的研究仍十分匮乏,尤其是在分词方面。本研究评估了三种常见分词算法与其他流行方法的适用性。具体而言,对字节对编码(BPE)、WordPiece和SentencePiece(Unigram)在宗卡语上的表现进行了评估。性能通过子词生育率、连续词比例、归一化序列长度和执行时间等指标进行衡量。结果表明,虽然三种算法均展现出潜力,但SentencePiece在宗卡语分词中最为有效,为进一步的NLP进展铺平了道路。这凸显了针对低资源语言定制方法的必要性以及持续研究的重要性。本研究为构建宗卡语大型语言模型奠定了基础。

关键词

引用

@article{arxiv.2509.15255,
  title  = {Comparative Analysis of Tokenization Algorithms for Low-Resource Language Dzongkha},
  author = {Tandin Wangchuk and Tad Gonsalves},
  journal= {arXiv preprint arXiv:2509.15255},
  year   = {2025}
}

备注

10 Pages