GPT 注意力层的反向注意力:注意力层的梯度下降
计算与语言
2024-12-24 v1
摘要
Transformer 基于语言模型(LMs)的成功归功于其注意力机制。尽管该机制在解释性研究中广泛研究,尤其是通过在 LMs 前向传递期间获取的注意力值,但注意力的反向传递在很大程度上被忽视。本文研究了注意力反向传递的数学性质,揭示其在计算我们称为"反向注意力"的注意力矩阵。我们检查了反向注意力的特性,并展示了其在解释模型行为和编辑动态方面的能力。在一个实验设置中,我们展示了反向注意力能够直接改变注意力的前向传递,而无需修改模型权重,这是通过一种新方法称为"注意力修补"实现的。除了增进对 LM 在反向传递期间如何配置注意力层的理解外,反向注意力图还为更可解释的反向传递贡献。
引用
@article{arxiv.2412.17019,
title = {Reversed Attention: On The Gradient Descent Of Attention Layers In GPT},
author = {Shahar Katz and Lior Wolf},
journal= {arXiv preprint arXiv:2412.17019},
year = {2024}
}