你会完成吗?部分 token 问题的实用研究
计算与语言
2026-02-04 v2
摘要
语言模型(LM)是在 token 序列上训练的,而用户通过文本与 LM 交互。这一差异导致了部分 token 问题,即用户在预期的下一个 token 中部结束提示,导致下一 token 预测失真。虽然该问题已通过任意字符前缀进行研究,但其在尊重词边界的现实提示中的流行程度和严重性仍未得到充分探讨。本文我们识别了三个 token 与"词"边界经常不一致的领域:不使用空白字符的语言、高度复合语言以及代码。例如,在中文中,最多有 25%的词边界不与 token 边界一致,即使是自然的、完整单词的提示也可能受此问题影响。我们系统构建了以部分 token 结尾的语义自然提示;在实验中,我们发现它们构成了严重的失效模式:前沿 LM 在正确续写上的概率与提示"回退"到 token 对齐时相差约三个数量级。这种降解随规模而不减,甚至对更大的模型往往更严重。最后,我们评估了针对部分 token 问题的推理时缓解措施,并验证了最近精确解决方案的有效性。总体而言,我们展示了分词在现实应用场景中导致的概率失真的规模和严重性,并为模型推理提供者提供实用建议。
关键词
引用
@article{arxiv.2601.23223,
title = {Are you going to finish that? A Practical Study of the Partial Token Problem},
author = {Hao Xu and Alisa Liu and Jonathan Hayase and Yejin Choi and Noah A. Smith},
journal= {arXiv preprint arXiv:2601.23223},
year = {2026}
}