基于实体扩展的知识感知语言模型预训练
计算与语言
2021-02-05 v2 机器学习
机器学习
摘要
预训练语言模型掌握多少知识?近期研究观察到预训练 transformer 善于建模语义,但其在多大程度上掌握人类知识,或如何确保其做到这一点,尚不清楚。本文在不改变 transformer 架构、不插入显式知识层、不添加语义信息外部存储的情况下,将知识感知引入语言模型预训练。相反,我们仅在预训练中输入端用实体扩展分词器向 transformer 输入标示实体存在,并在输出端增加额外的实体预测任务。我们的实验表明,仅通过在预训练中增加这些实体信号,就有显著更多的知识被装入 transformer 参数:我们观察到语言建模准确率提升、LAMA 知识探测任务中事实正确性提高,以及通过边探测得到的隐藏表示中语义增强。我们还展示我们的知识感知语言模型(KALM)可作为 GPT-2 模型的即插即用替代,在零样本问答等下游任务中无需任务相关训练即显著提升表现。
引用
@article{arxiv.2007.00655,
title = {Knowledge-Aware Language Model Pretraining},
author = {Corby Rosset and Chenyan Xiong and Minh Phan and Xia Song and Paul Bennett and Saurabh Tiwary},
journal= {arXiv preprint arXiv:2007.00655},
year = {2021}
}