中文

OpenBA:从零预训练的开源 15B 双语非对称 seq2seq 模型

计算与语言 2024-11-26 v2

摘要

具有数十亿参数的大语言模型(LLMs)在各种自然语言处理任务上展现出了卓越的性能。本报告提出 OpenBA,一个开源的 15B 双语非对称 seq2seq 模型,旨在为中文导向的开源模型社区贡献一个 LLM 变体。我们通过有效且高效的技术增强 OpenBA,并采用三阶段训练策略从零训练该模型。我们的方案仅使用 380B tokens 即可取得极具竞争力的性能,在 BELEBELE 基准上优于 LLaMA-70B,在 MMLU 基准上优于 BLOOM-176B,在 C-Eval(hard)基准上优于 GLM-130B。本报告提供了预训练同类模型的主要细节,包括预训练数据处理、双语 Flan 数据收集、启发我们模型架构设计的经验观察、不同阶段的训练目标,以及其他增强技术。此外,我们还提供了 OpenBA 在四个下游任务上的微调细节。我们重构了代码以遵循 Huggingface Transformers 库的设计原则,使开发者使用更为便捷,并在 https://huggingface.co/openBA 发布了不同训练阶段的检查点。我们项目的更多细节可在 https://github.com/OpenNLG/openBA.git 获取。

关键词

引用

@article{arxiv.2309.10706,
  title  = {OpenBA: An Open-sourced 15B Bilingual Asymmetric seq2seq Model Pre-trained from Scratch},
  author = {Juntao Li and Zecheng Tang and Yuyang Ding and Pinzheng Wang and Pei Guo and Wangjie You and Dan Qiao and Wenliang Chen and Guohong Fu and Qiaoming Zhu and Guodong Zhou and Min Zhang},
  journal= {arXiv preprint arXiv:2309.10706},
  year   = {2024}
}