中文

预训练语言模型的知识继承

计算与语言 2022-04-27 v2 人工智能 机器学习

摘要

近期对大规模预训练语言模型(PLMs)的探索揭示了具有海量参数的PLMs的能力,掀起了训练更大型PLMs的浪潮。然而,训练大规模PLM需要巨大的计算资源,这在实践中可能难以负担。此外,现有大规模PLM主要从零开始单独训练,忽视了已有许多训练良好的PLM可用的事实。为此,我们探究未来现有PLM如何裨益大规模PLM训练这一问题。具体而言,我们引入名为“知识继承”(KI)的预训练框架,并探索知识蒸馏如何作为预训练期间的辅助监督以高效学习更大的PLM。实验结果证明了KI在训练效率上的优越性。我们还进行实证分析以探究教师PLM预训练设置(包括模型架构、预训练数据等)的影响。最后,我们展示KI可应用于领域适配与知识迁移。

关键词

引用

@article{arxiv.2105.13880,
  title  = {Knowledge Inheritance for Pre-trained Language Models},
  author = {Yujia Qin and Yankai Lin and Jing Yi and Jiajie Zhang and Xu Han and Zhengyan Zhang and Yusheng Su and Zhiyuan Liu and Peng Li and Maosong Sun and Jie Zhou},
  journal= {arXiv preprint arXiv:2105.13880},
  year   = {2022}
}

备注

NAACL 2022