中文

Transformer 如何在符号程序中学习变量绑定

机器学习 2025-06-03 v2 人工智能 计算与语言

摘要

变量绑定——将变量与值相关联的能力——是符号计算与认知的基础。尽管经典架构通常通过可寻址内存实现变量绑定,但缺乏内置绑定操作的现代神经网络如何获得这一能力尚不清楚。我们通过训练 Transformer 在符号程序中对查询的变量进行解引用来研究这一问题,其中变量被赋值为数值常量或其他变量。每个程序要求跟踪最深达四步的变量赋值链以找到查询值,并且还包含作为干扰项的不相关赋值链。我们的分析揭示了训练过程中具有三个不同阶段的发展轨迹:(1) 数值常量的随机预测,(2) 优先考虑早期变量赋值的浅层启发式机制,以及 (3) 用于解引用赋值链的系统化机制的出现。通过因果干预,我们发现模型学会了利用残差流作为可寻址内存空间,并由专门的注意力头在词元位置之间路由信息。这一机制使模型能够跨层动态跟踪变量绑定,从而实现准确的解引用。我们的结果表明,Transformer 模型如何在缺乏显式架构支持的情况下学习实现系统化的变量绑定,从而连接了连接主义与符号方法。为促进可复现研究,我们开发了 Variable Scope,这是一个用于探索我们研究结果的交互式 Web 平台,网址为 https://variablescope.org

关键词

引用

@article{arxiv.2505.20896,
  title  = {How Do Transformers Learn Variable Binding in Symbolic Programs?},
  author = {Yiwei Wu and Atticus Geiger and Raphaël Millière},
  journal= {arXiv preprint arXiv:2505.20896},
  year   = {2025}
}

备注

16 pages, 10 figures, 1 table. To appear in the Proceedings of the 42nd International Conference on Machine Learning (ICML 2025). v2: Added link to Variable Scope in abstract