中文

LLM360:迈向完全透明的开源大语言模型

计算与语言 2023-12-12 v1 人工智能 机器学习

摘要

近期开源大语言模型(LLMs)的激增,例如LLaMA、Falcon和Mistral,为AI从业者和研究人员提供了多样化的选择。然而,大多数LLMs仅发布了部分产物,如最终的模型权重或推理代码,并且技术报告日益将其范围限制在高层次设计选择和表面统计数据上。这些选择通过降低LLM训练过程的透明度,并迫使团队重新发现训练过程中的许多细节,从而阻碍了该领域的进展。我们提出LLM360,这是一项旨在完全开源LLMs的倡议,倡导将所有训练代码和数据、模型检查点以及中间结果提供给社区。LLM360的目标是通过使端到端的LLM训练过程对每个人透明且可复现,来支持开放和协作的AI研究。作为LLM360的第一步,我们发布了两个从头开始预训练的7B参数LLMs,Amber和CrystalCoder,包括它们的训练代码、数据、中间检查点和分析(见https://www.llm360.ai)。我们致力于通过这一开源努力不断突破LLMs的边界。更多大规模和更强的模型正在开发中,并将在未来发布。

关键词

引用

@article{arxiv.2312.06550,
  title  = {LLM360: Towards Fully Transparent Open-Source LLMs},
  author = {Zhengzhong Liu and Aurick Qiao and Willie Neiswanger and Hongyi Wang and Bowen Tan and Tianhua Tao and Junbo Li and Yuqi Wang and Suqi Sun and Omkar Pangarkar and Richard Fan and Yi Gu and Victor Miller and Yonghao Zhuang and Guowei He and Haonan Li and Fajri Koto and Liping Tang and Nikhil Ranjan and Zhiqiang Shen and Xuguang Ren and Roberto Iriondo and Cun Mu and Zhiting Hu and Mark Schulze and Preslav Nakov and Tim Baldwin and Eric P. Xing},
  journal= {arXiv preprint arXiv:2312.06550},
  year   = {2023}
}