Jamba-1.5:大规模混合 Transformer-Mamba 模型
计算与语言
2024-08-23 v1 机器学习
摘要
我们提出 Jamba-1.5,新的基于 Jamba 架构的指令调优大语言模型。Jamba 是一种混合 Transformer-Mamba 专家模型架构,能够在各种上下文长度下实现高吞吐量和低内存使用,同时保持与 Transformer 模型相同的或更好的质量。我们发布了两个模型规模:Jamba-1.5-Large,拥有 94B 活跃参数,Jamba-1.5-Mini,拥有 12B 活跃参数。这两个模型都针对各种对话和指令遵循能力进行了微调,拥有 256K tokens 的有效上下文长度,是目前公开权重模型中最宽的。为支持成本有效的推理,我们引入了 ExpertsInt8,这是一种新颖的量化技术,允许在处理 256K tokens 上下文时将 Jamba-1.5-Large 部署在配备 8 块 80GB GPU 的机器上,而不会损失质量。在 academic 和 chatbot 基准测试中,Jamba-1.5 模型取得了优异的成绩,同时提供了高吞吐量,并在长上下文基准测试中超过了其他开源模型。两个规模的模型权重均在 Jamba Open Model License 下公开可用,我们将 ExpertsInt8 作为开源软件发布。
引用
@article{arxiv.2408.12570,
title = {Jamba-1.5: Hybrid Transformer-Mamba Models at Scale},
author = {Jamba Team and Barak Lenz and Alan Arazi and Amir Bergman and Avshalom Manevich and Barak Peleg and Ben Aviram and Chen Almagor and Clara Fridman and Dan Padnos and Daniel Gissin and Daniel Jannai and Dor Muhlgay and Dor Zimberg and Edden M Gerber and Elad Dolev and Eran Krakovsky and Erez Safahi and Erez Schwartz and Gal Cohen and Gal Shachaf and Haim Rozenblum and Hofit Bata and Ido Blass and Inbal Magar and Itay Dalmedigos and Jhonathan Osin and Julie Fadlon and Maria Rozman and Matan Danos and Michael Gokhman and Mor Zusman and Naama Gidron and Nir Ratner and Noam Gat and Noam Rozen and Oded Fried and Ohad Leshno and Omer Antverg and Omri Abend and Opher Lieber and Or Dagan and Orit Cohavi and Raz Alon and Ro'i Belson and Roi Cohen and Rom Gilad and Roman Glozman and Shahar Lev and Shaked Meirom and Tal Delbari and Tal Ness and Tomer Asida and Tom Ben Gal and Tom Braude and Uriya Pumerantz and Yehoshua Cohen and Yonatan Belinkov and Yuval Globerson and Yuval Peleg Levy and Yoav Shoham},
journal= {arXiv preprint arXiv:2408.12570},
year = {2024}
}
备注
Webpage: https://www.ai21.com/jamba