中文

从模仿到整合:预训练语言模型的知识整合

计算与语言 2022-10-12 v1 机器学习

摘要

研究更好地复用已发布预训练语言模型(PLM)的方法可以显著降低计算成本和潜在的环境副作用。本文探索了一种新颖的 PLM 复用范式——知识整合(KI)。在没有人工标注的情况下,KI 旨在将来自不同教师 PLM(每个专攻不同的分类问题)的知识整合到一个多功能的学生模型中。为了实现这一点,我们首先推导了虚拟黄金监督与教师预测之间的相关性。然后,我们设计了一个模型不确定性感知的知识整合(MUKI)框架,以恢复针对学生的黄金监督。具体而言,MUKI 采用 Monte-Carlo Dropout 来估计监督整合的模型不确定性。进一步引入了一种基于不确定性得分边界的逐实例重加权机制,以处理来自教师的潜在冲突监督。实验结果表明,MUKI 在基准数据集上取得了相对于基线的显著改进。进一步分析表明,MUKI 能够很好地泛化于合并具有异构架构的教师模型,甚至主攻跨语言数据集的教师。

关键词

引用

@article{arxiv.2210.05230,
  title  = {From Mimicking to Integrating: Knowledge Integration for Pre-Trained Language Models},
  author = {Lei Li and Yankai Lin and Xuancheng Ren and Guangxiang Zhao and Peng Li and Jie Zhou and Xu Sun},
  journal= {arXiv preprint arXiv:2210.05230},
  year   = {2022}
}

备注

EMNLP 2022 (Findings), an improved version of arXiv:2112.07327. Code will be available at https://github.com/lancopku/MUKI