中文

MiniCPM:通过可扩展训练策略揭示小语言模型的潜力

计算与语言 2024-06-04 v3 机器学习

摘要

对开发参数高达万亿的大语言模型(LLMs)日益增长的兴趣引发了关于资源效率和实际成本的担忧,特别是考虑到实验的巨大开销。这一背景凸显了探索小语言模型(SLMs)作为资源高效替代方案的潜力。在此背景下,我们介绍了MiniCPM,特别是1.2B和2.4B非嵌入参数变体,它们不仅在各自类别中表现出色,而且展示了与7B-13B LLMs相当的能力。在专注于SLMs的同时,我们的方法在模型和数据维度上均表现出可扩展性,适用于未来的LLM研究。在模型缩放方面,我们采用了广泛的模型风洞实验以实现稳定且最优的缩放。在数据缩放方面,我们引入了一种预热-稳定-衰减(WSD)学习率调度器(LRS),有利于持续训练和领域适应。我们对WSD LRS中出现的引人入胜的训练动态进行了深入分析。借助WSD LRS,我们现在能够高效地研究数据-模型缩放定律,而无需在模型和数据两个轴上进行大量的重新训练实验,由此我们得出了比Chinchilla最优更高的计算最优数据-模型比率。此外,我们介绍了MiniCPM系列,包括MiniCPM-DPO、MiniCPM-MoE和MiniCPM-128K,其卓越性能进一步巩固了MiniCPM在多样化SLM应用中的基础。MiniCPM模型已在https://github.com/OpenBMB/MiniCPM公开提供。

关键词

引用

@article{arxiv.2404.06395,
  title  = {MiniCPM: Unveiling the Potential of Small Language Models with Scalable Training Strategies},
  author = {Shengding Hu and Yuge Tu and Xu Han and Chaoqun He and Ganqu Cui and Xiang Long and Zhi Zheng and Yewei Fang and Yuxiang Huang and Weilin Zhao and Xinrong Zhang and Zheng Leng Thai and Kaihuo Zhang and Chongyi Wang and Yuan Yao and Chenyang Zhao and Jie Zhou and Jie Cai and Zhongwu Zhai and Ning Ding and Chao Jia and Guoyang Zeng and Dahai Li and Zhiyuan Liu and Maosong Sun},
  journal= {arXiv preprint arXiv:2404.06395},
  year   = {2024}
}

备注

revise according to peer review