大型语言模型的计数能力及其分词方式的影响
计算与语言
2024-10-30 v2 人工智能
摘要
Transformer 是现代大型语言模型 (LLM) 的核心,面临着内在的架构限制,阻碍其推理能力。与循环网络不同,Transformer lacks 循环连接,仅限于常数深度计算。这将其限制在 TC 复杂度类中,使其在输入长度增长时无法解决需要日益深入推理的任务。计数作为许多推理任务的基本组成部分,也需要推理深度随输入长度线性增长才能进行归纳。虽然先前的研究已确立基于 Transformer 专家模型(即专门训练用于计数任务的模型)计数能力的上限,但这些发现并不直接适用于通用 LLM,因为它们在推理机制上存在差异。最近的工作表明,链式思维 (Chain of Thought, CoT) 推理有助于缓解 Transformer 在计数任务中的某些架构限制。然而,关于分词方式在这些模型中的作用引起了很少的关注。与通常使用字符级分词的专家模型不同,LLM 通常依赖字节级 (BPE) 分词器,这从根本上改变了推理的处理方式。我们的工作调查了分词对 LLM 计数能力的影响,发现基于输入分词差异会导致显著的性能差异。我们提供了理论与实验分析,为如何选择分词方法以增强 LLM 推理提供了见解。
关键词
引用
@article{arxiv.2410.19730,
title = {Counting Ability of Large Language Models and Impact of Tokenization},
author = {Xiang Zhang and Juntai Cao and Chenyu You},
journal= {arXiv preprint arXiv:2410.19730},
year = {2024}
}