中文

理解 Transformer 中的加法与减法

机器学习 2025-10-06 v10 计算与语言

摘要

Transformer 已广泛应用于大型语言模型(LLM),但大多数模型在多位数加法等基本算术任务上仍然失败。相比之下,我们表明从头训练的小型 Transformer 能够以 99.999% 的准确率解决 n 位数加法和减法问题。在直接基于先前揭示加法电路的工作基础上,我们将分析扩展至减法,并提出了一种基于级联进位和借位电路的统一机制解释。利用一套 49 个训练好的模型,我们应用系统性消融和节点级约束来验证所学机制,并发布了一个可复现的可解释性工具包用于研究算术电路。最后,通过对 180 个公开可用的 LLM 进行调查,我们发现仅有 7% 的模型能够可靠地执行加法,这突显了专用小型模型与通用 LLM 之间的差距。我们的结果表明,算术可以由微型 Transformer 精确实现,为机制可解释性提供了一个可行的案例研究,并与大型模型持续的算术失败形成了警示性对比。

关键词

引用

@article{arxiv.2402.02619,
  title  = {Understanding Addition and Subtraction in Transformers},
  author = {Philip Quirke and Clement Neo and Fazl Barez},
  journal= {arXiv preprint arXiv:2402.02619},
  year   = {2025}
}

备注

9 pages, 5 figures, 4 tables