中文

足够吗?分词训练数据的收益递减

计算与语言 2025-06-17 v4 计算工程、金融与科学

摘要

分词是自然语言处理中的关键初始步骤,受到诸多关键参数的控制,如分词算法、词汇大小、预分词策略、推理策略以及训练数据语料库。本文研究了一个常被忽视的超参数——分词训练数据的规模。我们在词汇大小各不相同的基础上训练 BPE、UnigramLM 和 WordPiece 分词器,使用来自英语训练数据,规模从 1GB 到 900GB不等。我们的发现表明,随着训练数据规模超过约 150GB,改进效果呈递减趋势,表明通过额外数据获得的分词质量提升存在实际限制。我们分析了这一现象,将饱和效应归因于预分词阶段所引入的约束条件。随后,我们通过在俄语数据上进行实验来验证这些发现的可泛化性。对于俄语文本,我们观察到在使用 200GB 的数据训练分词器后,仍然出现递减效应,这约为英语的 33%。这些结果为优化分词过程提供了宝贵的见解,通过减少在大型语料库上的训练计算资源,同时为未来的分词算法研究指明了前景。

关键词

引用

@article{arxiv.2502.20273,
  title  = {How Much is Enough? The Diminishing Returns of Tokenization Training Data},
  author = {Varshini Reddy and Craig W. Schmidt and Yuval Pinter and Chris Tanner},
  journal= {arXiv preprint arXiv:2502.20273},
  year   = {2025}
}