GLM-130B:一个开放双语预训练模型
计算与语言
2023-10-26 v2 人工智能
机器学习
摘要
我们介绍 GLM-130B,一个拥有 1300 亿参数的双语(英文与中文)预训练语言模型。它试图开源一个至少与 GPT-3(davinci)同样好的 100B 规模模型,并揭示此类规模的模型如何能成功预训练。在此努力过程中,我们面临众多意外的技术与工程挑战,特别是损失尖峰与发散。本文中,我们介绍 GLM-130B 的训练过程,包括其设计选择、兼顾效率与稳定性的训练策略,以及工程努力。最终的 GLM-130B 模型在一系列流行的英文基准上显著优于 GPT-3 175B(davinci),而在 OPT-175B 与 BLOOM-176B 中未观察到此性能优势。它还在相关基准上持续且显著优于 ERNIE TITAN 3.0 260B——最大的中文语言模型。最后,我们利用 GLM-130B 独特的缩放性质实现无需训练后量化的 INT4 量化,且几乎无性能损失,使其成为 100B 规模模型中首个,更重要的是,使其能在 4RTX 3090(24G)或 8RTX 2080 Ti(11G)GPU 上有效推理,这是使用 100B 规模模型所需最实惠的 GPU。GLM-130B 模型权重公开可用,其代码、训练日志、相关工具包与经验教训已在 \url{https://github.com/THUDM/GLM-130B/} 开源。
引用
@article{arxiv.2210.02414,
title = {GLM-130B: An Open Bilingual Pre-trained Model},
author = {Aohan Zeng and Xiao Liu and Zhengxiao Du and Zihan Wang and Hanyu Lai and Ming Ding and Zhuoyi Yang and Yifan Xu and Wendi Zheng and Xiao Xia and Weng Lam Tam and Zixuan Ma and Yufei Xue and Jidong Zhai and Wenguang Chen and Peng Zhang and Yuxiao Dong and Jie Tang},
journal= {arXiv preprint arXiv:2210.02414},
year = {2023}
}
备注
Accepted to ICLR 2023