中文

破损标记?您的语言模型可以秘密处理非标准标记化

计算与语言 2026-02-04 v2

摘要

现代标记化器采用确定性算法将文本映射到单个“标准”标记序列,然而同一字符串可通过标记化器词汇表编码为众多非标准标记化。本文研究了语言模型对以非标准标记化编码的文本的鲁棒性。令人惊讶的是,在评估 20 个基准测试时,我们发现指令调优模型在给定随机抽取的标记化后仍能保留最高 93.4% 的原始性能,字符级标记化下为 90.8%。我们发现,整体上更强的模型更具鲁棒性,随着标记化偏离标准形式的程度增加,鲁棒性会下降。令人鼓舞的是这些结果,我们随后识别出非标准标记化方案可*提升*性能的情形,发现字符级分段在字符串操作和代码理解任务中提升最高可达 +14%,右对齐数字分组在大数算术中提升可达 +33%。最后,我们研究了这种鲁棒性的来源,发现它源于指令调优阶段。我们展示了虽然基础模型和后训练模型都理解非标准标记化的语义(将其视为包含拼写错误),但基础模型试图模仿想象中的错误而退化为无意义的输出,而后训练模型致力于流畅的响应。总体而言,我们的发现表明模型与其标记化器的绑定程度低于人们之前所认为的,并演示了在推理时干预标记化以提升性能的潜力。

关键词

引用

@article{arxiv.2506.19004,
  title  = {Broken Tokens? Your Language Model can Secretly Handle Non-Canonical Tokenizations},
  author = {Brian Siyuan Zheng and Alisa Liu and Orevaoghene Ahia and Jonathan Hayase and Yejin Choi and Noah A. Smith},
  journal= {arXiv preprint arXiv:2506.19004},
  year   = {2026}
}

备注

NeurIPS 2025 (spotlight)