Falcon 系列开放语言模型
计算与语言
2023-12-01 v2 人工智能
摘要
我们介绍了 Falcon 系列:在主要由网络数据构成的多样化高质量语料库上训练的 7B、40B 和 180B 参数因果仅解码器模型。其中最大的模型 Falcon-180B 已在超过 3.5 万亿 token 的文本上完成训练——这是公开记录中规模最大的预训练运行。Falcon-180B 显著优于 PaLM 或 Chinchilla 等模型,并优于同期开发的 LLaMA 2 或 Inflection-1 等模型。它以更低的预训练和推理成本接近 PaLM-2-Large 的性能,据我们所知,这使其成为与 GPT-4 和 PaLM-2-Large 并列的全球三大最佳语言模型之一。我们报告了详细评估,并深入探讨了用于预训练 Falcon 的方法与定制工具。值得注意的是,我们报告了自定义的分布式训练代码库,使我们能够在互联受限的云 AWS 基础设施上用最多 4096 块 A100 高效预训练这些模型。我们发布了一个 600B token 的网络数据集抽取,以及在宽松许可下的 Falcon-7/40/180B 模型,以促进开放科学并加速开放大语言模型生态的发展。
引用
@article{arxiv.2311.16867,
title = {The Falcon Series of Open Language Models},
author = {Ebtesam Almazrouei and Hamza Alobeidli and Abdulaziz Alshamsi and Alessandro Cappelli and Ruxandra Cojocaru and Mérouane Debbah and Étienne Goffinet and Daniel Hesslow and Julien Launay and Quentin Malartic and Daniele Mazzotta and Badreddine Noune and Baptiste Pannier and Guilherme Penedo},
journal= {arXiv preprint arXiv:2311.16867},
year = {2023}
}