无界字节对编码:突破预分词壁垒
计算与语言
2025-10-03 v2 人工智能
摘要
预分词是许多现代分词流程中的初始步骤,它将文本分割成称为预分词的较小单元,通常按空格和标点进行分割。虽然这一过程有助于将完整的单个单词作为词元,但它给大多数分词算法(如字节对编码(BPE))带来了根本性的限制。具体来说,预分词导致语料库中词元的分布严重偏向于常见的完整单词。这种偏斜分布限制了扩展至更大词汇量的好处,因为新增词元的出现频率逐渐降低。为了克服这一障碍,我们提出了BoundlessBPE,一种改进的BPE算法,它放宽了预分词边界约束。我们的方法选择性地将两个完整的预分词合并成一个更大的单元,我们称之为超词。超词不一定在语义上连贯。例如,预分词“ of”和“ the”可能被组合成超词“ of the”。这种合并策略使得语料库中词元的分布比标准BPE更加均匀,并且更有效地压缩文本,每个词元的字节数最多增加15%。
引用
@article{arxiv.2504.00178,
title = {Boundless Byte Pair Encoding: Breaking the Pre-tokenization Barrier},
author = {Craig W. Schmidt and Varshini Reddy and Chris Tanner and Yuval Pinter},
journal= {arXiv preprint arXiv:2504.00178},
year = {2025}
}
备注
Accepted to COLM 2025