中文

Peek2:面向边缘设备 LLM 推理的无正则表达式字节级 BPE 预分词器

计算与语言 2026-05-04 v2

摘要

预分词是字节级 BPE 分词器中一个关键的顺序处理步骤,但针对边缘端推理对其进行优化的研究却很少。我们提出的新实现 Peek2,可作为 GPT-3、LLaMa-3 和 Qwen-2.5 中使用的类 cl100k 预分词器的直接替代方案。在分解并分析了原始 cl100k 预分词器的逻辑后,我们引入了一种具有线性时间复杂度和恒定、极低内存占用的新预分词算法,适用于边缘场景。测试结果表明,根据数据集的不同,它将微基准测试吞吐量提高了高达 2.48×2.48\times,并在整个字节级 BPE 编码过程中将整体吞吐量提升了 1.14×1.14\times,同时提供了与基于正则表达式的基线分词器相同的结果。

关键词

引用

@article{arxiv.2601.05833,
  title  = {Peek2: Regex-free Byte-level Byte-Pair Encoding Pretokenizer for LLM Inference on Edge Devices},
  author = {Liu Zai and Iraklis Klampanos},
  journal= {arXiv preprint arXiv:2601.05833},
  year   = {2026}
}

备注

7 pages, 5 figures, accepted to ACL SRW 2026, for associated code, see https://github.com/omegacoleman/tokenizers_peek2 v2: updated to match accepted version in ACL SRW 2026