中文

博士导师还是医疗状况:迈向知识库属性的实体特定排序 [扩展版]

信息检索 2017-09-21 v1 人工智能 计算与语言 数据库

摘要

在 Wikidata 等知识库中,可以为实体断言大量属性,从通用的属性(如姓名和出生地)到高度特定于职业或背景的属性(如博士导师或医疗状况)。在此类大型属性集中确定偏好或排序,在编辑优先级排序或自然语言生成等任务中是一项挑战。以往大多数对知识库属性进行排序的方法纯粹是数据驱动的,正如我们所表明的,这会将频率误认为趣味性。在本工作中,我们构建了一个包含 350 个偏好判断的人工标注数据集,这些判断针对固定实体的知识库属性对。从该集合中,我们分离出人类表现出高水平一致性(平均 87.5%)的属性对子集。然而我们表明,基线与最先进的技术在预测该子集的人类偏好时仅达到 61.3% 的精度。随后我们分析了是什么导致一个属性被评为比另一个更重要,并确定至少有三个因素起作用,即 频率、 对类似实体的适用性以及 属性与实体之间的语义相似度。我们实验性地分析了每个因素的贡献,并表明结合解决所有这三个因素的技术在该任务上达到了 74% 的精度。该数据集可在 www.kaggle.com/srazniewski/wikidatapropertyranking 获取。

关键词

引用

@article{arxiv.1709.06907,
  title  = {Doctoral Advisor or Medical Condition: Towards Entity-specific Rankings of Knowledge Base Properties [Extended Version]},
  author = {Simon Razniewski and Vevake Balaraman and Werner Nutt},
  journal= {arXiv preprint arXiv:1709.06907},
  year   = {2017}
}

备注

Extended version of an ADMA 2017 conference paper