中文

字节 BPE 分词作为逆字符串同态

计算与语言 2024-12-05 v1

摘要

分词是大型语言模型(LLM)训练和推理中重要的预处理步骤。尽管已有大量研究关注 LLM 所采用的神经网络架构的表达力,但分词的影响尚未得到充分理解。本文证明了无论采用何种分词算法,分词都可视为字符串与标记之间存在的逆同态映射。这表明源语言的字符空间与分词后语言的标记空间是同态的,能够保持源语言的结构属性。此外,我们探讨了“恰当分词”的概念,即指从分词器返回的无歧义分词结果。我们的分析表明,神经网络在识别上下文无关语言方面的表达力并不受分词方式的影响。

关键词

引用

@article{arxiv.2412.03160,
  title  = {Byte BPE Tokenization as an Inverse string Homomorphism},
  author = {Saibo Geng and Sankalp Gambhir and Chris Wendler and Robert West},
  journal= {arXiv preprint arXiv:2412.03160},
  year   = {2024}
}