中文

TeenyTinyLlama:基于巴西葡萄牙语训练的开源微型语言模型

计算与语言 2024-05-20 v3 机器学习

摘要

大型语言模型(LLMs)显著推动了自然语言处理的发展,但其进展在不同语言间并不均衡。虽然大多数大型语言模型是在英语等高资源语言上训练的,但多语言模型通常表现不如单语模型。此外,其多语言基础的某些方面有时会限制其产生的副产品,例如计算需求和许可制度。在本研究中,我们记录了专为低资源环境定制的开放基础模型的开发过程、其局限性及其优势。这就是 TeenyTinyLlama 对:两个用于巴西葡萄牙语文本生成的紧凑模型。我们在 GitHub 和 Hugging Face 上以宽松的 Apache 2.0 许可证发布它们,供社区使用和进一步开发。参见 https://github.com/Nkluge-correa/TeenyTinyLlama

关键词

引用

@article{arxiv.2401.16640,
  title  = {TeenyTinyLlama: open-source tiny language models trained in Brazilian Portuguese},
  author = {Nicholas Kluge Corrêa and Sophia Falk and Shiza Fatimah and Aniket Sen and Nythamar de Oliveira},
  journal= {arXiv preprint arXiv:2401.16640},
  year   = {2024}
}

备注

21 pages, 5 figures