中文

回到字节:通过 UTF-8 重新审视分词

计算与语言 2025-10-21 v1

摘要

我们提出 UTF8Tokenizer,这是一种极简主义的字节级分词器,将文本映射到与文本底层 UTF-8 编码对应的 ID(例如,字节 x09 对应 token ID 9)。与先前的字节级方法(Xue 等,2021;Pagnoni 等,2025)不同,我们的实现从不引入超出范围的 ID(即没有 token ID 256)或辅助 token:所有特殊行为(如填充、边界、对话结构、注意力分段、工具调用、"思考" 范围等)都通过 C0 控制字节编码——正如 ASCII 最初设计的方式一样,将控制信息与可打印文本一起嵌入。这些设计原则带来了实际收益:(1)更快的分词速度(快 14 倍)和显著降低的主机-设备传输(仅为 int64 的 1/8);(2)简单、可共享的 256*d 嵌入表,可跨模型对齐;(3)通过位偏置嵌入的训练时增强,这暴露了每个字节的位结构,可在训练后添加到嵌入表中,消除推理成本。我们的 HuggingFace 兼容实现改进了语言模型的收敛。

关键词

引用

@article{arxiv.2510.16987,
  title  = {Back to Bytes: Revisiting Tokenization Through UTF-8},
  author = {Amit Moryossef and Clara Meister and Pavel Stepachev and Desmond Elliott},
  journal= {arXiv preprint arXiv:2510.16987},
  year   = {2025}
}