Transformer 本质上是多状态 RNN
计算与语言
2024-06-19 v2
摘要
Transformer 被认为在概念上不同于上一代最先进的 NLP 模型——循环神经网络(RNN)。在这项工作中,我们证明仅解码器 Transformer 实际上可以被概念化为无界多状态 RNN——一种具有无限隐藏状态大小的 RNN 变体。我们进一步表明,通过固定其隐藏状态的大小,Transformer 可以被转换为有界多状态 RNN,从而有效压缩其键值缓存。我们引入了一种新颖的、无需训练的压缩策略——基于注意力的令牌省略(TOVA)。我们使用四个长程任务和多个 LLM 进行的实验表明,TOVA 优于多种基线压缩策略。特别是,我们的结果几乎与完整模型相当,在某些情况下仅使用原始缓存大小的 1/8,这意味着吞吐量提高了 4.8 倍。我们的结果揭示了 Transformer 与 RNN 之间的联系,并有助于缓解 LLM 最痛苦的计算瓶颈之一——其键值缓存的大小。我们在 https://github.com/schwartz-lab-NLP/TOVA 公开发布了我们的代码。
引用
@article{arxiv.2401.06104,
title = {Transformers are Multi-State RNNs},
author = {Matanel Oren and Michael Hassid and Nir Yarden and Yossi Adi and Roy Schwartz},
journal= {arXiv preprint arXiv:2401.06104},
year = {2024}
}
备注
preprint