中文

UTF-8 管道:字节级分词器不可避免地使 LLM 生成格式错误的 UTF-8

计算与语言 2025-11-11 v1

摘要

子词分词按预定义词汇表对输入文本进行分段以供语言模型使用;语言模型随后生成由同一词汇表构成的序列。词汇表的成员可以由代码点或字节构成。使用代码点意味着词汇表的所有成员都是有效的 UTF-8 字符。然而,这需要数千个初始成员才能获得对输入的可接受覆盖。相反,从字节开始,只需 256 个初始词汇表成员即可避免词汇表外错误,但词汇表的成员及其序列不一定是有效的 UTF-8。无效 UTF-8 序列会破坏假设其输入为有效 UTF-8 的代码。应用语言模型的系统必须考虑由此引入的破坏。本文运用单子理论形式化分词,证明词汇表包含格式错误 UTF-8 令牌的分词器始终可以产生格式错误 UTF-8 的序列。我们形式化地证明,尝试逐步将令牌转换回字符串并解释为 UTF-8 的结果,与一次性转换整个令牌序列的結果不同。该形式结果预测了实际中的 bug:我们评估了本问题的缓解措施,并提供了主要基础模型、推理引擎和受限生成系统的案例研究。

关键词

引用

@article{arxiv.2511.05578,
  title  = {UTF-8 Plumbing: Byte-level Tokenizers Unavoidably Enable LLMs to Generate Ill-formed UTF-8},
  author = {Preston Firestone and Shubham Ugare and Gagandeep Singh and Sasa Misailovic},
  journal= {arXiv preprint arXiv:2511.05578},
  year   = {2025}
}

备注

COLM 2025