中文

符号知识蒸馏:从通用语言模型到常识模型

计算与语言 2022-11-30 v2

摘要

训练常识模型的常见实践经历了从人类到语料库再到机器:人类编写常识知识图谱以训练常识模型。在本工作中,我们研究了一种替代方案,从机器到语料库再到机器:通用语言模型编写这些常识知识图谱来训练常识模型。我们的研究引出了一个新框架——符号知识蒸馏。与知识蒸馏的先前工作(Hinton 等,2015)一样,我们的方法使用更大的模型来教导更小的模型。一个关键区别在于,我们除了神经模型外,还将知识以符号形式(作为文本)进行蒸馏。我们也仅蒸馏一个方面——通用语言模型教师的常识,使得学生可以是不同类型,即常识模型。总体而言,我们表明精心的提示工程和单独训练的评判模型使我们能够从通用语言模型 GPT-3 中有选择地蒸馏出高质量的因果常识。实证结果表明,首次在数量、质量和多样性这三个标准上,人工编写的常识知识图谱被我们的自动蒸馏变体超越。此外,它产生了一个神经常识模型,尽管规模比教师模型小 100 倍,却在常识能力上超越了教师模型。我们将其应用于 ATOMIC 资源,并分享了我们的新符号知识图谱和常识模型。

关键词

引用

@article{arxiv.2110.07178,
  title  = {Symbolic Knowledge Distillation: from General Language Models to Commonsense Models},
  author = {Peter West and Chandra Bhagavatula and Jack Hessel and Jena D. Hwang and Liwei Jiang and Ronan Le Bras and Ximing Lu and Sean Welleck and Yejin Choi},
  journal= {arXiv preprint arXiv:2110.07178},
  year   = {2022}
}