中文

上下文学习蒸馏:迁移预训练语言模型的少样本学习能力

计算与语言 2022-12-22 v1 机器学习

摘要

鉴于大型预训练语言模型在上下文学习方面取得的成功,我们引入了上下文学习蒸馏,以将上下文少样本学习能力从大型模型迁移到小型模型。我们提出将上下文学习目标与语言建模目标相结合,将读取上下文示例的能力和任务知识共同蒸馏到小型模型中。我们在两种不同的少样本学习范式下进行上下文学习蒸馏:元上下文微调(Meta-ICT)和多任务上下文微调(Multitask-ICT)。Multitask-ICT 在多任务少样本学习上表现更好,但比 Meta-ICT 需要更多的计算量。我们的方法在 LAMA 和 CrossFit 两个基准测试上对 Meta-ICT 和 Multitask-ICT 均显示出持续的改进。我们广泛的实验和分析表明,在 Multitask-ICT 范式下,上下文学习目标与语言建模目标是互补的。当与语言建模目标结合时,上下文学习目标取得了最佳性能。

关键词

引用

@article{arxiv.2212.10670,
  title  = {In-context Learning Distillation: Transferring Few-shot Learning Ability of Pre-trained Language Models},
  author = {Yukun Huang and Yanda Chen and Zhou Yu and Kathleen McKeown},
  journal= {arXiv preprint arXiv:2212.10670},
  year   = {2022}
}