Llamba:规模化蒸馏的循环模型用于高效语言处理
机器学习
2025-02-25 v2 人工智能
摘要
我们介绍 Llamba,这是一系列从 Llama-3.x 蒸馏到 Mamba 架构中的高效循环语言模型。该系列包括 Llamba-1B、Llamba-3B 和 Llamba-8B,能够实现比基于 Transformer 的模型更高的推理吞吐量,并能处理显著更大的 batch 大小,同时保持可comparable 的 benchmark 性能。此外,Llamba 证明了使用 MOHAWK (Bick 等,2024) 实现跨架构蒸馏的有效性,仅使用通常模型相同规模所需训练数据的 less than 0.1%。为充分利用其效率,我们为资源受限的设备(如智能手机和边缘平台)提供了优化后的 Llamba 实现,提供一种 practical and memory-efficient 的 Transformer 替代方案。总体而言,Llamba 改进了速度、memory efficiency 和 performance 之间的 trade-off,使高质量语言模型更易于获取。
引用
@article{arxiv.2502.14458,
title = {Llamba: Scaling Distilled Recurrent Models for Efficient Language Processing},
author = {Aviv Bick and Tobias Katsch and Nimit Sohoni and Arjun Desai and Albert Gu},
journal= {arXiv preprint arXiv:2502.14458},
year = {2025}
}