中文

知识图谱补全方法的现实重评估:一项实验研究

人工智能 2020-03-19 v1 计算与语言

摘要

在利用嵌入模型进行知识图谱补全(尤其是链接预测任务)这一活跃研究领域中,多数先前研究使用FB15k和WN18两个基准数据集评估此类模型。这些及此类研究中其他数据集的大部分三元组属于反向与重复关系,由于语义重复、关联或数据不完整而呈现高数据冗余。这是一种过度的数据泄漏——模型在训练时使用了在需要应用于真实预测时本不可用的特征。还存在笛卡尔积关系,即由适用主体与客体的笛卡尔积构成的每个三元组均为真实事实。在上述关系上的链接预测是容易的,甚至可使用简单规则而非复杂嵌入模型以更高准确率完成。这些模型更根本的缺陷在于,给定此类数据,链接预测场景在现实世界中并不存在。本文是首个以评估剔除不现实三元组后嵌入模型真实有效性为主要目标的系统性研究。我们的实验结果表明,这些模型的准确率远低于我们以往的认为。其糟糕的准确率使得链接预测成为一项尚无真正有效自动化解决方案的任务。因此,我们呼吁重新探究可能有效的途径。

关键词

引用

@article{arxiv.2003.08001,
  title  = {Realistic Re-evaluation of Knowledge Graph Completion Methods: An Experimental Study},
  author = {Farahnaz Akrami and Mohammed Samiul Saeef and Qingheng Zhang and Wei Hu and Chengkai Li},
  journal= {arXiv preprint arXiv:2003.08001},
  year   = {2020}
}

备注

accepted to SIGMOD 2020