CPM-2:大规模高性价比预训练语言模型
计算与语言
2021-06-25 v3
摘要
近年来,预训练语言模型(PLMs)的规模呈飞跃式增长。然而,这些大规模 PLMs 的效率问题限制了其在真实场景中的使用。我们提出一套高性价比的 PLM 使用技术,以应对预训练、微调与推理中的效率问题。(1)我们引入知识继承,通过利用现有 PLMs 而非从零训练模型来加速预训练过程。(2)我们探索了大规模 PLMs 下提示微调的最佳实践。相比传统微调,提示微调显著减少了任务特定参数的数量。(3)我们实现了一个新推理工具包,即 InfMoE,以在有限计算资源下使用大规模 PLMs。基于我们的高性价比流程,我们预训练了两个模型:一个含 110 亿参数的编码器-解码器双语模型(CPM-2),及其对应的含 1980 亿参数的 MoE 版本。在实验中,我们将 CPM-2 与 mT5 在下游任务上比较。实验结果表明 CPM-2 具有优异的通用语言智能。此外,我们验证了 InfMoE 在单块 GPU 上对具有数百亿参数的大规模模型进行推理时的效率。所有源代码与模型参数可在 https://github.com/TsinghuaAI/CPM 获取。
引用
@article{arxiv.2106.10715,
title = {CPM-2: Large-scale Cost-effective Pre-trained Language Models},
author = {Zhengyan Zhang and Yuxian Gu and Xu Han and Shengqi Chen and Chaojun Xiao and Zhenbo Sun and Yuan Yao and Fanchao Qi and Jian Guan and Pei Ke and Yanzheng Cai and Guoyang Zeng and Zhixing Tan and Zhiyuan Liu and Minlie Huang and Wentao Han and Yang Liu and Xiaoyan Zhu and Maosong Sun},
journal= {arXiv preprint arXiv:2106.10715},
year = {2021}
}