中文

更快的超词元化

计算与语言 2026-04-08 v1

摘要

字节对编码(BPE)是一种广泛使用的分词算法,其标记无法跨越预分词边界,从而在功能上限制其最多只能表示完整单词。BoundlessBPE和SuperBPE算法放宽了这一限制,允许形成由多个预词组合而成的"超词"(superwords)。然而,之前的实现在实际操作中难以实践:例如,BoundlessBPE在1GB数据上训练耗时4.7个CPU天。我们表明,超合并候选(即两个或多个连续的可形成超合并的预词)可以像处理常规预词一样通过频率进行聚合。这避免了保留完整文档的需求(原始实现中BoundlessBPE和SuperBPE都需要),从而实现了显著的训练加速。我们提出了BoundlessBPE的两种阶段方案,将第一阶段的常规合并学习与第二阶段的超合并学习分离,产生与原始实现相同的结果。我们还显示两种阶段BoundlessBPE与SuperBPE在近似等价上,区别在于SuperBPE中用于手动选择的超参数可在BoundlessBPE第二阶段中自动确定。这些变更使得更快的实现成为可能,使1GB数据的训练时间分别为BoundlessBPE和SuperBPE为603和593秒,速度提升超过600倍。对于BoundlessBPE、SuperBPE和BPE,我们均开源了参考Python实现和高速Rust实现。

关键词

引用

@article{arxiv.2604.05192,
  title  = {Faster Superword Tokenization},
  author = {Craig W. Schmidt and Chris Tanner and Yuval Pinter},
  journal= {arXiv preprint arXiv:2604.05192},
  year   = {2026}
}