中文

基于实体扩展的知识感知语言模型预训练

计算与语言 2021-02-05 v2 机器学习 机器学习

摘要

预训练语言模型掌握多少知识?近期研究观察到预训练 transformer 善于建模语义,但其在多大程度上掌握人类知识,或如何确保其做到这一点,尚不清楚。本文在不改变 transformer 架构、不插入显式知识层、不添加语义信息外部存储的情况下,将知识感知引入语言模型预训练。相反,我们仅在预训练中输入端用实体扩展分词器向 transformer 输入标示实体存在,并在输出端增加额外的实体预测任务。我们的实验表明,仅通过在预训练中增加这些实体信号,就有显著更多的知识被装入 transformer 参数:我们观察到语言建模准确率提升、LAMA 知识探测任务中事实正确性提高,以及通过边探测得到的隐藏表示中语义增强。我们还展示我们的知识感知语言模型(KALM)可作为 GPT-2 模型的即插即用替代,在零样本问答等下游任务中无需任务相关训练即显著提升表现。

关键词

引用

@article{arxiv.2007.00655,
  title  = {Knowledge-Aware Language Model Pretraining},
  author = {Corby Rosset and Chenyan Xiong and Minh Phan and Xia Song and Paul Bennett and Saurabh Tiwary},
  journal= {arXiv preprint arXiv:2007.00655},
  year   = {2021}
}