线性化大语言模型
计算与语言
2024-05-13 v1
摘要
线性Transformer已成为softmax注意力的一种次二次时间复杂度替代方案,并因其固定大小的循环状态能降低推理成本而引起了广泛关注。然而,其原始形式存在扩展性差的问题,且性能不及计算量匹配的Transformer。近期的线性模型,如RWKV和Mamba,试图通过提出新颖的时间混合和门控架构来解决这些缺点,但预训练大型语言模型需要大量的数据和计算投入。因此,对次二次架构的搜索受到计算资源和高质量预训练数据集可用性的限制。作为预训练线性Transformer的一种经济高效的替代方案,我们提出了可扩展的循环注意力向上训练(SUPRA)。我们提出了一种方法,以适度的计算预算将现有的大型预训练Transformer向上训练为循环神经网络(RNN)。这使我们能够利用现有Transformer LLM强大的预训练数据和性能,同时仅需5%的训练成本。我们发现,我们的线性化技术在标准基准测试上取得了有竞争力的性能,但我们发现即使对于最大的线性模型,也存在持续的上下文学习和长上下文建模方面的不足。我们的代码和模型可在https://github.com/TRI-ML/linear_open_lm找到。
引用
@article{arxiv.2405.06640,
title = {Linearizing Large Language Models},
author = {Jean Mercat and Igor Vasiljevic and Sedrick Keh and Kushal Arora and Achal Dave and Adrien Gaidon and Thomas Kollar},
journal= {arXiv preprint arXiv:2405.06640},
year = {2024}
}