中文

I2D2:基于 NeuroLogic 与自我模仿的归纳式知识蒸馏

计算与语言 2023-05-29 v3

摘要

预训练语言模型的常识能力随规模扩大而显著提升,这使许多人认为规模是唯一的制胜之道。但果真如此吗?本文探索一种看似不可能的替代方案:若配备新颖的常识蒸馏算法,较小的语言模型(如 GPT-2)能否战胜规模大数个数量级且性能更优的模型(如 GPT-3)?核心的智力挑战在于设计一种不依赖规模优势即可达到有竞争力常识获取水平的学习算法。我们特别研究常识知识的生成模型,聚焦于生成泛化陈述的任务,即关于日常概念的常识事实陈述,例如“鸟会飞”。我们提出 I2D2,一种新颖的常识蒸馏框架,该框架大致遵循 West 等人的符号知识蒸馏,但通过两项创新打破了对超大规模教师模型的依赖:(1) 创新性地采用 NeuroLogic 解码来提升现成的弱语言模型的生成质量;(2) 通过自我模仿学习,迭代地从模型自身增强的常识获取能力中学习。实证结果表明,规模并非唯一途径,新颖的算法可以成为一种有前景的替代方案。此外,我们的研究催生了一个新的泛称陈述语料库 Gen-A-tomic,这是迄今为止规模最大、质量最高的同类语料库。

关键词

引用

@article{arxiv.2212.09246,
  title  = {I2D2: Inductive Knowledge Distillation with NeuroLogic and Self-Imitation},
  author = {Chandra Bhagavatula and Jena D. Hwang and Doug Downey and Ronan Le Bras and Ximing Lu and Lianhui Qin and Keisuke Sakaguchi and Swabha Swayamdipta and Peter West and Yejin Choi},
  journal= {arXiv preprint arXiv:2212.09246},
  year   = {2023}
}

备注

ACL 2023