在括号序列转换器中分离可解性与因果性
计算与语言
2026-04-27 v1 机器学习
摘要
在训练需理解层次结构任务的转换器时,已发现其对层次结构的表示方式存在两种不同形式:一种是残差流几何中的表征,另一种是保持后进先出顺序的类栈注意力模式。然而,尚不清楚这些表征是否被因果性地使用,或仅是可解码的。我们考察了在括号平衡序列(Dyck 语言)训练的转换器中的这一差距,在该语言中层次结构的ground truth是显式的。通过对残差流和注意力模式进行探针分析与干预,我们发现深度、距离和栈顶信号均可被解码,但其因果作用存在差异。具体而言,屏蔽对true栈顶位置的注意力会导致长距离准确率急剧下降,而削弱低维残差流子空间的效果则相对较小。这些结果在模板化自然语言环境中也得到延续,表明即便在相关层次变量已知的受控环境中,仅凭可解性并不足以保证因果作用。
引用
@article{arxiv.2604.22128,
title = {Dissociating Decodability and Causal Use in Bracket-Sequence Transformers},
author = {Aryan Sharma and Cutter Dawes and Shivam Raval},
journal= {arXiv preprint arXiv:2604.22128},
year = {2026}
}