中文

困惑度能否预测微调性能?分词对尼泊尔语顺序语言模型影响的探究

计算与语言 2025-08-12 v2 机器学习

摘要

子词分词对语言模型性能的影响在困惑度方面已有充分记录,更细的粒度持续降低这一内在指标。然而,关于不同分词方案如何影响模型理解能力的研究仍然有限,特别是对于非拉丁字母语言。为填补这一空白,我们通过预训练基于Transformer的尼泊尔语语言模型并在多个下游任务上评估其性能,对六种不同的分词策略进行了全面评估。尽管近期著名模型如GPT、RoBERTa、Claude、LLaMA、Mistral、Falcon和MPT采用了字节级BPE分词,我们的发现表明,对于尼泊尔语,SentencePiece分词在基于理解的任务上始终产生更优的结果。与以往主要关注基于BERT架构的研究不同,我们的研究专门考察了顺序Transformer模型,为低资源语言的语言模型开发提供了宝贵见解,并强调了分词策略超越困惑度降低的重要性。

关键词

引用

@article{arxiv.2404.18071,
  title  = {Can Perplexity Predict Fine-tuning Performance? An Investigation of Tokenization Effects on Sequential Language Models for Nepali},
  author = {Nishant Luitel and Nirajan Bekoju and Anand Kumar Sah and Subarna Shakya},
  journal= {arXiv preprint arXiv:2404.18071},
  year   = {2025}
}

备注

11 pages