从 token 到字符的标记化能力:LLM 无法直接实现的拼写
计算与语言
2025-06-13 v1
摘要
大语言模型(LLMs)能够以高准确率逐字符拼写 token,但在更复杂的字符级任务(如识别 token 中由多个子组件组成的部分)时表现不佳。本文我们考察 LLMs 在拼写过程中如何内部表示和利用字符级信息。我们的分析揭示,尽管拼写对人类而言是简单任务,但 LLMs 并未以直接方式处理。具体而言,我们展示嵌入层并未完全编码超出第一个字符之外的字符级信息。因此,LLMs 依赖中间及更高 Transformer 层来重构字符级知识,其中我们观察到其拼写行为出现明显的“突破”。我们通过三种互补分析验证了这一机制:探针分类器、知识神经元识别以及注意力权重检查。
关键词
引用
@article{arxiv.2506.10641,
title = {Spelling-out is not Straightforward: LLMs' Capability of Tokenization from Token to Characters},
author = {Tatsuya Hiraoka and Kentaro Inui},
journal= {arXiv preprint arXiv:2506.10641},
year = {2025}
}