中文

面向预训练语言模型的知识反刍

计算与语言 2023-10-12 v3 人工智能 信息检索 机器学习

摘要

先前的研究表明,原始的预训练语言模型(PLM)单独处理知识密集型 NLP 任务的能力不足;因此,若干工作尝试将外部知识整合进 PLM。然而,尽管结果令人鼓舞,我们通过实证观察到 PLM 可能已在其预训练参数中编码了丰富的知识,但在将其应用于知识密集型任务时未能充分利用。在本文中,我们提出一种称为知识反刍(Knowledge Rumination)的新范式,以帮助预训练语言模型利用相关的潜在知识,而无需从外部语料库中检索。通过简单地向 PLM 添加诸如“据我所知”的提示,我们尝试回顾相关的潜在知识并将其注入模型以进行知识巩固。我们将所提出的知识反刍应用于多种语言模型,包括 RoBERTa、DeBERTa 和 GPT-3。在六个常识推理任务和 GLUE 基准上的实验结果证明了我们提出方法的有效性,这表明存储在 PLM 中的知识可以被更好地利用以提升性能。代码见 https://github.com/zjunlp/knowledge-rumination。

关键词

引用

@article{arxiv.2305.08732,
  title  = {Knowledge Rumination for Pre-trained Language Models},
  author = {Yunzhi Yao and Peng Wang and Shengyu Mao and Chuanqi Tan and Fei Huang and Huajun Chen and Ningyu Zhang},
  journal= {arXiv preprint arXiv:2305.08732},
  year   = {2023}
}

备注

EMNLP 2023