语言模型即开放知识图谱
计算与语言
2020-10-26 v1 人工智能
机器学习
摘要
本文展示了如何在无人类监督下,从预训练语言模型(如 BERT、GPT-2/3)构建知识图谱(KGs)。流行的 KGs(如 Wikidata、NELL)以监督或半监督方式构建,需人类创建知识。近期的深度语言模型通过预训练从大规模语料自动获取知识。所存储的知识已使语言模型得以改进下游 NLP 任务,例如回答问题、编写代码与文章。本文中,我们提出一种无监督方法,将语言模型内含的知识转化为 KGs。我们表明,通过对语料做一次预训练语言模型的前向传播(无需微调)即可构建 KGs。我们通过与两个由人类创建的 KGs(Wikidata、TAC KBP)比较,展示了所构建 KGs 的质量。我们的 KGs 还提供了现有 KGs 中新的开放事实知识。我们的代码与 KGs 将公开可用。
引用
@article{arxiv.2010.11967,
title = {Language Models are Open Knowledge Graphs},
author = {Chenguang Wang and Xiao Liu and Dawn Song},
journal= {arXiv preprint arXiv:2010.11967},
year = {2020}
}
备注
30 pages, 32 figures, 3 tables