bert2BERT:面向可复用的预训练语言模型
计算与语言
2021-10-15 v1
摘要
近年来,研究者倾向于预训练更大的语言模型以探索深度模型的上限。然而,大型语言模型预训练消耗大量计算资源,且多数模型从零开始训练,未复用现有预训练模型,造成浪费。本文提出 bert2BERT,可通过参数初始化将现有较小预训练模型(如 BERT_BASE)的知识有效迁移至大型模型(如 BERT_LARGE),显著提升大型模型的预训练效率。具体而言,我们扩展了此前基于 Transformer 的语言模型的函数保持方法,并通过提出用于大模型初始化的进阶知识进一步改进。此外,提出两阶段预训练方法以进一步加速训练过程。我们在代表性 PLM(如 BERT 和 GPT)上进行了大量实验,表明(1)与包括从零学习、StackBERT 和 MSLT 在内的基线相比,我们的方法可节省大量训练成本;(2)我们的方法具有通用性,适用于不同类型预训练模型。特别地,bert2BERT 通过复用尺寸约为其一半的模型,分别节省了预训练 BERT_BASE 和 GPT_BASE 约 45% 和 47% 的计算成本。源代码将在发表后公开。
引用
@article{arxiv.2110.07143,
title = {bert2BERT: Towards Reusable Pretrained Language Models},
author = {Cheng Chen and Yichun Yin and Lifeng Shang and Xin Jiang and Yujia Qin and Fengyu Wang and Zhi Wang and Xiao Chen and Zhiyuan Liu and Qun Liu},
journal= {arXiv preprint arXiv:2110.07143},
year = {2021}
}