Falcon Mamba:基于新型 Mamba 架构的首个竞争性无注意力 7B 语言模型
计算与语言
2024-10-10 v1 人工智能
摘要
本技术报告介绍了Falcon Mamba 7B,这是一个基于新型Mamba架构的新型基础大语言模型。Falcon Mamba 7B在精心挑选的数据混合方案上进行了5.8万亿token的训练。作为纯粹的Mamba模型,Falcon Mamba 7B在基于Transformer的领先开源模型(如Mistral 7B、Llama3.1 8B和Falcon2 11B)中取得领先成绩。它与Gemma 7B持平,并优于采用不同架构设计的模型(如RecurrentGemma 9B和RWKV-v6 Finch 7B/14B)。根据Open LLM Leaderboard,Falcon Mamba 7B目前是该规模下最佳的Mamba模型,优于现有的Mamba模型和混合Mamba-Transformer模型。由于其架构,Falcon Mamba 7B在推理速度和长序列生成所需的内存方面显著优于Transformer模型。尽管近期研究表明混合Mamba-Transformer模型可能优于纯架构设计,但我们展示了即使是纯Mamba设计也能实现与Transformer和混合设计相当或更好的效果。我们将Falcon Mamba 7B的模型权重在https://huggingface.co/tiiuae/falcon-mamba-7b上以宽松许可证公开。
引用
@article{arxiv.2410.05355,
title = {Falcon Mamba: The First Competitive Attention-free 7B Language Model},
author = {Jingwei Zuo and Maksim Velikanov and Dhia Eddine Rhaiem and Ilyas Chahed and Younes Belkada and Guillaume Kunsch and Hakim Hacid},
journal= {arXiv preprint arXiv:2410.05355},
year = {2024}
}