中文

Transformer 本质上是多状态 RNN

计算与语言 2024-06-19 v2

摘要

Transformer 被认为在概念上不同于上一代最先进的 NLP 模型——循环神经网络(RNN)。在这项工作中,我们证明仅解码器 Transformer 实际上可以被概念化为无界多状态 RNN——一种具有无限隐藏状态大小的 RNN 变体。我们进一步表明,通过固定其隐藏状态的大小,Transformer 可以被转换为有界多状态 RNN,从而有效压缩其键值缓存。我们引入了一种新颖的、无需训练的压缩策略——基于注意力的令牌省略(TOVA)。我们使用四个长程任务和多个 LLM 进行的实验表明,TOVA 优于多种基线压缩策略。特别是,我们的结果几乎与完整模型相当,在某些情况下仅使用原始缓存大小的 1/8,这意味着吞吐量提高了 4.8 倍。我们的结果揭示了 Transformer 与 RNN 之间的联系,并有助于缓解 LLM 最痛苦的计算瓶颈之一——其键值缓存的大小。我们在 https://github.com/schwartz-lab-NLP/TOVA 公开发布了我们的代码。

关键词

引用

@article{arxiv.2401.06104,
  title  = {Transformers are Multi-State RNNs},
  author = {Matanel Oren and Michael Hassid and Nir Yarden and Yossi Adi and Roy Schwartz},
  journal= {arXiv preprint arXiv:2401.06104},
  year   = {2024}
}

备注

preprint