Griffin:混合门控线性循环与局部注意力的高效语言模型
机器学习
2024-03-01 v1 计算与语言
摘要
循环神经网络(RNN)具有快速推理能力且在长序列上可扩展性良好,但难以训练且难以扩展。我们提出了 Hawk,一种具有门控线性循环的 RNN,以及 Griffin,一种将门控线性循环与局部注意力混合的混合模型。Hawk 在下游任务上的表现超过了 Mamba 的报告性能,而 Griffin 尽管训练的 token 数量减少了 6 倍以上,其性能仍与 Llama-2 相当。我们还表明,Griffin 可以外推到比训练期间所见序列长得多的序列。我们的模型在训练期间具有与 Transformer 相当的硬件效率,而在推理期间具有更低的延迟和显著更高的吞吐量。我们将 Griffin 扩展至 14B 参数,并解释了如何对模型进行分片以实现高效的分布式训练。
引用
@article{arxiv.2402.19427,
title = {Griffin: Mixing Gated Linear Recurrences with Local Attention for Efficient Language Models},
author = {Soham De and Samuel L. Smith and Anushan Fernando and Aleksandar Botev and George Cristian-Muraru and Albert Gu and Ruba Haroun and Leonard Berrada and Yutian Chen and Srivatsan Srinivasan and Guillaume Desjardins and Arnaud Doucet and David Budden and Yee Whye Teh and Razvan Pascanu and Nando De Freitas and Caglar Gulcehre},
journal= {arXiv preprint arXiv:2402.19427},
year = {2024}
}
备注
25 pages, 11 figures