分词的重要性:分词对前沿大语言模型算术能力的影响
计算与语言
2024-02-26 v1 机器学习
摘要
分词(将输入文本划分为输入标记)是大型语言模型(LLM)流程中一个常被忽视的方面,可能是有用或有害的归纳偏置的来源。历史上,LLM依赖字节对编码,而不关心特定输入领域。随着LLM越来越多地用于推理,各种针对数字的分词方案被采用,流行的模型如LLaMa和PaLM选择单数字分词,而GPT-3.5和GPT-4对每个1位、2位和3位数字有单独的标记。在这项工作中,我们通过算术任务研究这种选择对数值推理的影响。我们考虑GPT-3.5和GPT-4的从左到右和从右到左分词,发现从右到左分词(在推理时通过逗号分隔数字强制实现)导致性能大幅提升。此外,我们发现使用标准从左到右分词时模型错误遵循刻板的错误模式,表明模型计算是系统性的而非近似性的。我们表明模型能够轻松地在分词方向之间转换,从而允许受思维链启发的方法恢复从左到右分词输入的性能。我们还发现,当模型规模扩大时,分词方向之间的差距减小,这可能表明更大的模型能够更好地覆盖这种依赖于分词的归纳偏置。总之,我们的工作首次研究了数字分词选择如何导致算术任务中模型性能的差异,并附带了错误模式的深入分析。我们希望这项工作能激励实践者在开发通用数值推理模型时更仔细地消融与数字分词相关的选择。
引用
@article{arxiv.2402.14903,
title = {Tokenization counts: the impact of tokenization on arithmetic in frontier LLMs},
author = {Aaditya K. Singh and DJ Strouse},
journal= {arXiv preprint arXiv:2402.14903},
year = {2024}
}
备注
21 pages, 18 figures