中文

BTLM-3B-8K:3B 参数模型达到 7B 参数性能

人工智能 2023-09-22 v1 计算与语言 机器学习

摘要

我们介绍了 Bittensor 语言模型,称为“BTLM-3B-8K”,这是一个全新的最先进的 30 亿参数开源语言模型。BTLM-3B-8K 在 SlimPajama 数据集上以 2,048 和 8,192 上下文长度混合的方式训练了 627B tokens。BTLM-3B-8K 在下游任务上以 2-5.5% 的优势超越所有现有的 3B 参数模型。BTLM-3B-8K 甚至与某些 7B 参数模型具有竞争力。此外,BTLM-3B-8K 提供了优异的长上下文性能,在长达 8,192 上下文长度的任务上优于 MPT-7B-8K 和 XGen-7B-8K。我们在清洗并去重后的 SlimPajama 数据集上训练该模型;激进地调优了 \textmu P 超参数与调度;使用了 ALiBi 位置嵌入;并采用了 SwiGLU 非线性。在 Hugging Face 上,最流行的模型具有 7B 参数,表明用户偏好 7B 模型的质量-规模比。将 7B 参数模型压缩为 3B 参数且性能影响甚微,是一个重要里程碑。BTLM-3B-8K 在 4-bit 精度下仅需 3GB 内存,推理计算量比 7B 模型少 2.5 倍,有助于在移动和边缘设备上开放访问强大的语言模型。BTLM-3B-8K 可在 Hugging Face 上基于 Apache 2.0 许可证获取:https://huggingface.co/cerebras/btlm-3b-8k-base。

关键词

引用

@article{arxiv.2309.11568,
  title  = {BTLM-3B-8K: 7B Parameter Performance in a 3B Parameter Model},
  author = {Nolan Dey and Daria Soboleva and Faisal Al-Khateeb and Bowen Yang and Ribhu Pathria and Hemant Khachane and Shaheer Muhammad and Zhiming and Chen and Robert Myers and Jacob Robert Steeves and Natalia Vassilieva and Marvin Tom and Joel Hestness},
  journal= {arXiv preprint arXiv:2309.11568},
  year   = {2023}
}