TinyLlama:一个开源小型语言模型
计算与语言
2024-06-05 v2 人工智能
摘要
我们推出了 TinyLlama,这是一个紧凑的 1.1B 语言模型,在约 1 万亿 token 上预训练了大约 3 个 epoch。TinyLlama 基于 Llama 2 的架构和分词器,并利用开源社区贡献的各项进展(如 FlashAttention 和 Lit-GPT),实现了更高的计算效率。尽管规模相对较小,TinyLlama 在一系列下游任务中仍展现出卓越的性能,显著优于现有同等规模的开源语言模型。我们的模型检查点和代码已在 GitHub 上公开,地址为 https://github.com/jzhang38/TinyLlama。
引用
@article{arxiv.2401.02385,
title = {TinyLlama: An Open-Source Small Language Model},
author = {Peiyuan Zhang and Guangtao Zeng and Tianduo Wang and Wei Lu},
journal= {arXiv preprint arXiv:2401.02385},
year = {2024}
}
备注
Technical Report