低秩稀疏分解理解注意力本质
机器学习
2025-04-30 v1 计算与语言
摘要
我们提出 Low-Rank Sparse Attention (Lorsa),一种用于解�od 多头自注意力 (MHSA) 的稀疏替换模型,将其分解为可单独理解的组成部分。Lorsa 旨在解决注意力叠加的挑战,以理解注意力在不同 token 位置之间所起的交互作用。我们展示,Lorsa 注意力头发现了更干净、更细粒度的先前发现的 MHSA 行为,例如 induction heads、successor heads 和注意力沉底行为(即高度关注第一个 token)。Lorsa 和稀疏自动编码器 (SAE) 都是应用于不同 Transformer 组件的稀疏字典学习方法,具有许多一致的发现。例如,我们发现一系列专为算术设计的 Lorsa 注意力头,每个都对应 Llama-3.1-8B 中的一个原子操作。自动可解释性分析表明,Lorsa 在可解释性方面达到与 SAE 相同的水平,而 Lorsa 在特别是由多个 MHSA 注意力头共同计算的特征方面表现出更好的电路发现特性。我们还进行了大量的架构设计消除实验、Lorsa 比例定律和错误分析。
关键词
引用
@article{arxiv.2504.20938,
title = {Towards Understanding the Nature of Attention with Low-Rank Sparse Decomposition},
author = {Zhengfu He and Junxuan Wang and Rui Lin and Xuyang Ge and Wentao Shu and Qiong Tang and Junping Zhang and Xipeng Qiu},
journal= {arXiv preprint arXiv:2504.20938},
year = {2025}
}