中文

语言模型即开放知识图谱

计算与语言 2020-10-26 v1 人工智能 机器学习

摘要

本文展示了如何在无人类监督下,从预训练语言模型(如 BERT、GPT-2/3)构建知识图谱(KGs)。流行的 KGs(如 Wikidata、NELL)以监督或半监督方式构建,需人类创建知识。近期的深度语言模型通过预训练从大规模语料自动获取知识。所存储的知识已使语言模型得以改进下游 NLP 任务,例如回答问题、编写代码与文章。本文中,我们提出一种无监督方法,将语言模型内含的知识转化为 KGs。我们表明,通过对语料做一次预训练语言模型的前向传播(无需微调)即可构建 KGs。我们通过与两个由人类创建的 KGs(Wikidata、TAC KBP)比较,展示了所构建 KGs 的质量。我们的 KGs 还提供了现有 KGs 中新的开放事实知识。我们的代码与 KGs 将公开可用。

关键词

引用

@article{arxiv.2010.11967,
  title  = {Language Models are Open Knowledge Graphs},
  author = {Chenguang Wang and Xiao Liu and Dawn Song},
  journal= {arXiv preprint arXiv:2010.11967},
  year   = {2020}
}

备注

30 pages, 32 figures, 3 tables