中文

TinyLlama:一个开源小型语言模型

计算与语言 2024-06-05 v2 人工智能

摘要

我们推出了 TinyLlama,这是一个紧凑的 1.1B 语言模型,在约 1 万亿 token 上预训练了大约 3 个 epoch。TinyLlama 基于 Llama 2 的架构和分词器,并利用开源社区贡献的各项进展(如 FlashAttention 和 Lit-GPT),实现了更高的计算效率。尽管规模相对较小,TinyLlama 在一系列下游任务中仍展现出卓越的性能,显著优于现有同等规模的开源语言模型。我们的模型检查点和代码已在 GitHub 上公开,地址为 https://github.com/jzhang38/TinyLlama。

关键词

引用

@article{arxiv.2401.02385,
  title  = {TinyLlama: An Open-Source Small Language Model},
  author = {Peiyuan Zhang and Guangtao Zeng and Tianduo Wang and Wei Lu},
  journal= {arXiv preprint arXiv:2401.02385},
  year   = {2024}
}

备注

Technical Report