大型语言模型(LLM)为何难以计数字母?
计算与语言
2024-12-30 v1
摘要
大型语言模型(LLM)在许多复杂任务上实现了空前的性能,能够例如就几乎任何话题回答问题。然而,它们在其他简单任务中存在困境,例如计数单词中字母的出现次数,正如许多LLM无法计数“strawberry”中“r”字母的数量所示。已有多篇工作研究了这一问题,并将其与LLM使用的分词有关、注意力机制的内在局限性有关,或与缺乏字符级训练数据有关有关。本文进行一项实验研究,以评估LLM在计数字母时出现的错误与1)单词及其组成部分在训练数据集中的频率以及2)计数操作的复杂度之间的关系。我们对LLM在计数字母出现次数时所出现的错误进行全面分析,通过在大量单词上评估一组代表性模型。结果显示,评估的模型呈现出若干一致性趋势:1)模型能够识别字母但无法计数;2)单词和单词中标记的频率对LLM错误没有显著影响;3)字母频率与错误呈正相关,更频繁的字母倾向于产生更多计数错误;4)错误与单词中字母数或标记数呈强相关;5)与字母数(计数大于1)的最强相关性,大多数模型无法正确计数字母出现次数超过两次的单词。
引用
@article{arxiv.2412.18626,
title = {Why Do Large Language Models (LLMs) Struggle to Count Letters?},
author = {Tairan Fu and Raquel Ferrando and Javier Conde and Carlos Arriaga and Pedro Reviriego},
journal= {arXiv preprint arXiv:2412.18626},
year = {2024}
}