中文

面向预训练语言模型的常识知识迁移

计算与语言 2023-06-06 v1 人工智能 机器学习

摘要

尽管预训练语言模型作为众多 NLP 基准的基础模型,但相较于学习在文本表层模式中更显式出现的语言与事实知识,其仅通过自监督获取隐式常识知识的能力有限。本文引入常识知识迁移,一种将存储于神经常识知识模型中的常识知识迁移至通用预训练语言模型的框架。它首先利用通用文本构造查询以从神经常识知识模型抽取常识知识,随后以两个自监督目标精炼语言模型:常识掩码填充与常识关系预测,从而使人类语言与底层常识知识相对齐。实证结果表明,我们的方法持续提升了模型在需要常识推理的下游任务上的表现。此外,我们发现该提升在少样本设定下更为显著。这表明我们的方法通过将常识知识注入参数,帮助语言模型在缺乏大量监督时更好地迁移至下游任务。

关键词

引用

@article{arxiv.2306.02388,
  title  = {Commonsense Knowledge Transfer for Pre-trained Language Models},
  author = {Wangchunshu Zhou and Ronan Le Bras and Yejin Choi},
  journal= {arXiv preprint arXiv:2306.02388},
  year   = {2023}
}

备注

ACL 2023 Findings