正确答案,错误方向:为何变形器在计数任务中失败及其修复
机器学习
2026-05-18 v2 计算与语言
摘要
大型语言模型常在简单计数任务中失败,即使待计数的项目已出现在提示中。我们探究此失败是由于变形器未在内部表示计数,还是由于其无法将表示转化为正确的输出标记。我们检验了 Pythia、Qwen3 和 Mistral 三个模型家族,参数规模从 0.4B 到 14B 不等,发现第二种解释更符合事实。线性探针可在中间层以 的效果恢复正确计数,表明信息确在其中。然而,编码计数的内部方向几乎与数字标记输出层行向量垂直(),换言之,模型以模型不自然读取的形式存储计数。我们用两种干预措施局化此失败:仅更新数字行的输出头(36,864 参数)显著提升受约束的数字预测准确率(60.7--100.0%),但未修复无约束生成(0%);我们不主张仅靠数字行修复即可解决开放式文本生成。相比之下,对注意力 Q/V进行小规模 LoRA(7.67M 参数)可提升上游路由,实现 83.1%7.2% 的真实贪婪自回归生成(可部署式修复方案)。在层 35 的 Logit-lens(实体计数;正确数字排名)中:(i) 三随机种子中位数从十进制量级降至 1;(ii) 随机种子 42 显示 (其中一个随机种子仍显著偏低)。范数、Logit-lens 与跨任务分析将瓶颈推广至计数、加法和列表长度;对 MMLU 和 GSM8K 的空值检验以及有限的 DROP 迁移。这些结果表明,计数失败源于几何读取瓶颈,而非内部表示瓶颈:模型已知晓计数,但输出路径未与所需标记对齐。
引用
@article{arxiv.2605.03258,
title = {The Right Answer, the Wrong Direction: Why Transformers Fail at Counting and How to Fix It},
author = {Gabriel Garcia},
journal= {arXiv preprint arXiv:2605.03258},
year = {2026}
}
备注
27 pages, 3 figures, 18 tables. Code: https://github.com/Gpgabriel25/GeometricReadoutBottleneck