中文

KEPLER:一种融合知识嵌入与预训练语言表示的统一模型

计算与语言 2020-11-24 v3

摘要

预训练语言表示模型(PLMs)难以很好地从文本中捕获事实知识。相比之下,知识嵌入(KE)方法能够通过信息丰富的实体嵌入有效表示知识图谱(KGs)中的关系事实,但传统的 KE 模型无法充分利用丰富的文本信息。本文提出一种用于知识嵌入与预训练语言表示(KEPLER)的统一模型,其不仅可以将事实知识更好地整合进 PLMs,还能借助强大的 PLMs 产生有效的文本增强 KE。在 KEPLER 中,我们使用 PLM 对文本实体描述进行编码作为其嵌入,然后联合优化 KE 与语言建模目标。实验结果表明,KEPLER 在多种 NLP 任务上取得了 state-of-the-art 性能,并且作为归纳式 KE 模型在 KG 链接预测上也表现优异。此外,为预训练和评估 KEPLER,我们构建了 Wikidata5M——一个带有对齐实体描述的大规模 KG 数据集,并在其上对 state-of-the-art 的 KE 方法进行了基准测试。该数据集将作为新的 KE 基准,并促进对大规模 KG、归纳式 KE 以及带文本的 KG 的研究。源代码可从 https://github.com/THU-KEG/KEPLER 获取。

关键词

引用

@article{arxiv.1911.06136,
  title  = {KEPLER: A Unified Model for Knowledge Embedding and Pre-trained Language Representation},
  author = {Xiaozhi Wang and Tianyu Gao and Zhaocheng Zhu and Zhengyan Zhang and Zhiyuan Liu and Juanzi Li and Jian Tang},
  journal= {arXiv preprint arXiv:1911.06136},
  year   = {2020}
}

备注

Accepted to TACL