中文

基于知识图谱的合成语料生成用于知识增强语言模型预训练

计算与语言 2021-03-16 v2

摘要

先前关于数据到文本生成(即将知识图谱(KG)三元组转换为自然语言文本)的研究集中于特定领域基准数据集。然而,本文将整个英文 Wikidata 知识图谱转化为文本,并讨论广泛、开放域、大规模文本化所面临的独特挑战。我们进一步表明,将像 Wikidata 这样全面、百科式的知识图谱文本化,可用于整合结构化 KG 与自然语言语料。与为整合这两类来源而开发的众多架构不同,我们的方法将 KG 转换为自然文本,从而可无缝集成到现有语言模型中。它还具有提升事实准确性以及降低所得语言模型毒性的额外优势。我们通过在一个检索语言模型中扩充检索语料,并展示在开放域问答与 LAMA 知识探针等的知识密集型任务上的显著提升,来评估该方法。

关键词

引用

@article{arxiv.2010.12688,
  title  = {Knowledge Graph Based Synthetic Corpus Generation for Knowledge-Enhanced Language Model Pre-training},
  author = {Oshin Agarwal and Heming Ge and Siamak Shakeri and Rami Al-Rfou},
  journal= {arXiv preprint arXiv:2010.12688},
  year   = {2021}
}

备注

Accepted at NAACL 2021