将注意力解释为绑定:基于向量-符号的变换器推理
人工智能
2025-12-18 v1 机器学习
摘要
变换器基础语言模型在推理类任务上表现出惊人的类推理行为,但在需要稳定符号操作的任务上仍显脆弱。本文通过将自注意力和残差流解释为实现近似向量符号架构(Vector Symbolic Architecture, VSA)的机制,提出了对这些现象的统一视角。在此视图中,查询和键定义角色空间,值编码填充符,注意力权重执行软解绑定,残差连接实现许多绑定结构的叠加。我们利用这种代数视角将变换器内部关联到链式思维痕迹、基于程序的推理和记忆增强工具使用,并解释了诸如变量混淆和逻辑相关提示之间不一致性等典型失效模式。建立在此视角基础上,我们提出了包括显式绑定/解绑定头和超高维记忆层的 VSA 启发的架构偏置,以及促进角色-填充分离和稳健叠加的训练目标。最后,我们概述了衡量 "VSA-likeliness" 和逻辑组成性的指标,提出了理论和架构层面的开放问题。总体而言,本文认为将注意力解释为软向量符号计算,为实现更可解释和逻辑可靠的推理系统提供了原则性的路径。
引用
@article{arxiv.2512.14709,
title = {Attention as Binding: A Vector-Symbolic Perspective on Transformer Reasoning},
author = {Sahil Rajesh Dhayalkar},
journal= {arXiv preprint arXiv:2512.14709},
year = {2025}
}
备注
12 pages with references. Submitted to 'Logical and Symbolic Reasoning in Language Models @ AAAI 2026' conference and is under review