中文

UNIQORN:基于RDF知识图谱与自然语言文本的统一问答

信息检索 2024-09-24 v9 计算与语言

摘要

对RDF数据(如知识图谱)的问答已取得重大进展,许多优秀系统能为自然语言问题或电报式查询提供准确答案。其中一些系统将文本源作为回答过程的额外证据,但无法计算仅存在于文本中的答案。反之,IR和NLP社区已研究过文本上的QA,但此类系统几乎未利用语义数据和知识。本文提出一种处理复杂问题的方法,可在统一框架中无缝作用于RDF数据集与文本语料的混合或单一来源。我们的方法称为UNIQORN,通过微调的BERT模型从RDF数据和/或文本语料中检索与问题相关的证据,即时构建上下文图。所得图通常包含所有问题相关证据,但也有大量噪声。UNIQORN通过用于组斯坦纳树(Group Steiner Trees)的图算法应对该输入,在上下文图中识别最佳答案候选。在多个含多实体与关系的复杂问题基准上的实验表明,UNIQORN在完全训练模式与零样本设置下均显著优于异构QA的最先进方法。该基于图的方法为完整回答过程提供了用户可解释的证据。

关键词

引用

@article{arxiv.2108.08614,
  title  = {UNIQORN: Unified Question Answering over RDF Knowledge Graphs and Natural Language Text},
  author = {Soumajit Pramanik and Jesujoba Alabi and Rishiraj Saha Roy and Gerhard Weikum},
  journal= {arXiv preprint arXiv:2108.08614},
  year   = {2024}
}

备注

28 pages, to appear in the Elsevier Journal of Web Semantics (December 2024 Issue)