LiteToken:从 BPE 分词器中移除中间合并残留
计算与语言
2026-02-05 v1
摘要
分词是语言模型表示和处理文本的基本方式,但广泛使用的 BPE 分词器的行为相较于模型架构和训练方式研究远不足。本文研究了 BPE 词汇表中的中间合并残留:在合并学习期间频繁出现且因此被保留在最终词汇表中的标记,但在标记化语料期间很少被发射且大多被进一步合并。此类低频标记不仅会浪费词汇容量,还会增加对对抗性或非典型输入的脆弱性。我们对此现象在常见分词器上的系统经验性特征进行了描述,并提出了一种简单的方法 LiteToken,用于移除残留标记。由于受影响的标记使用频率较低,预训练模型通常可以在不额外微调的情况下适应修改后的分词器。实验表明,LiteToken 减少了标记碎片化,降低了参数数量,并提高了对噪声或拼写错误输入的鲁棒性,同时保持整体性能。
引用
@article{arxiv.2602.04706,
title = {LiteToken: Removing Intermediate Merge Residues From BPE Tokenizers},
author = {Yike Sun and Haotong Yang and Zhouchen Lin and Muhan Zhang},
journal= {arXiv preprint arXiv:2602.04706},
year = {2026}
}