中文

全俱:LLM 在最后一 token 通过信息转自行解答心算

计算与语言 2025-09-12 v1

摘要

大型语言模型 (LLM) 在诸多计算任务中表现出色,但其内部工作机制仍不清晰。理论上,因果自注意力和多层感知器层的组合允许每个 token 访问并基于所有前导 token 进行计算。在实践中,这种操作到何种程度有效?本文在心算任务上进行研究(即通过下一个 token 预测直接进行数学计算,而不使用显式推理),我们三步法检验该问题:抑制初始层中的输入特定 token 计算、限制信息在后续若干层中跨 token 位置的传输路径、强制所有计算在剩余层中仅在最后一个 token 上发生。通过两种提出的技术,Context-Aware Mean Ablation (CAMA) 和 Attention-Based Peeking (ABP),我们识别出一个高精度的 All-for-One 子图 (AF1),其在广泛的心算任务上表现良好,其中有意义的计算仅在层深度上非常晚(即最后一个 token 上),该 token 在少数几个特定中间层接收到其他 token 的信息。实验在多种模型和算术表达式上表明,该子图足够且必要用于高模型性能,跨模型可迁移,并适用于各种输入样式。对不同 CAMA 和 ABP 备选方案的消除实验揭示了它们相对于其他方法的独特优势,这可能本身也具有独立的兴趣。

关键词

引用

@article{arxiv.2509.09650,
  title  = {All for One: LLMs Solve Mental Math at the Last Token With Information Transferred From Other Tokens},
  author = {Siddarth Mamidanna and Daking Rai and Ziyu Yao and Yilun Zhou},
  journal= {arXiv preprint arXiv:2509.09650},
  year   = {2025}
}

备注

EMNLP 2025 Main Conference