中文

超越词生育率:将 STRR 作为多语言分词评估指标的分析

计算与语言 2025-10-28 v2 人工智能 机器学习

摘要

分词是大语言模型(LLMs)中至关重要却评估不足的一环。标准指标——词生育率(fertility,即每个词的平均 token 数)——刻画了压缩效率,但掩盖了词表在语言与领域间的分配方式。我们分析了七种语言、两个领域中六种广泛使用的分词器,发现英语的词生育率稳定、中文的词生育率较高,且领域敏感性较低。为弥补词生育率的盲点,我们提出了单 token 保留率(Single Token Retention Rate, STRR),用以衡量被保留为单个 token 的词所占的比例。STRR 揭示了对英语的系统性优先、对中文的强有力支持,以及印地语中的碎片化现象,为跨语言公平性提供了可解释的视角。我们的结果表明,STRR 与词生育率互为补充,并为设计更加公平的多语言分词器提供了切实可行的指导。

关键词

引用

@article{arxiv.2510.09947,
  title  = {Beyond Fertility: Analyzing STRR as a Metric for Multilingual Tokenization Evaluation},
  author = {Mir Tafseer Nayeem and Sawsan Alqahtani and Md Tahmid Rahman Laskar and Tasnim Mohiuddin and M Saiful Bari},
  journal= {arXiv preprint arXiv:2510.09947},
  year   = {2025}
}

备注

NeurIPS 2025 Workshop