中文

通过统一隐式注意力公式解释现代门控线性RNN

机器学习 2024-10-21 v2

摘要

近期高效序列建模的进展催生了多种免注意力层,例如Mamba、RWKV以及各类门控RNN,它们均具有序列长度上的次二次复杂度与优异的扩展性,从而能够构建新型基础模型。本文提出了这些模型的统一视角,将此类层形式化为隐式因果自注意力层。该形式化涵盖了它们的大部分子组件,且不局限于架构的特定部分。该框架在相似基础上比较了不同层的底层机制,并提供了直接应用可解释性方法的手段。我们的实验表明,我们提出的注意力矩阵与归因方法优于近期为Mamba提出的另一种更局限的形式化。对于其他架构(我们的方法是首个为此类架构提供该视角的),我们的方法在相关指标上有效且具有竞争力,其结果可与最先进的Transformer可解释性方法相媲美。我们的代码已公开。

关键词

引用

@article{arxiv.2405.16504,
  title  = {Explaining Modern Gated-Linear RNNs via a Unified Implicit Attention Formulation},
  author = {Itamar Zimerman and Ameen Ali and Lior Wolf},
  journal= {arXiv preprint arXiv:2405.16504},
  year   = {2024}
}