中文

用计数量词丰富知识库

计算与语言 2018-07-11 v1

摘要

信息抽取传统上聚焦于抽取可识别实体间的关系,例如 <Monterey, locatedIn, California>。然而,文本中也常包含计数信息,即陈述某个主体与一定数量的对象处于特定关系中而未提及对象本身,例如“加利福尼亚被划分为 58 个县”。此类计数量词可助力查询回答或知识库整理等多种任务,却被以往工作所忽视。本文开发了首个从文本中抽取计数信息的成熟系统,称为 CINEX。我们采用远程监督,以知识库中的事实计数作为训练种子,并提出了应对若干挑战的新技术:(i)因知识库不完整导致的非极大训练种子,(ii)文本来源中稀疏且偏斜的观测,以及(iii)语言模式的高度多样性。对五个人工评估关系的实验表明,CINEX 抽取计数信息可达到 60% 的平均精度。在大规模实验中,我们将 CINEX 应用于 Wikidata 中 2,474 个高频关系,展示了知识库丰富的潜力。CINEX 可为 110 个不同关系断言 250 万条事实的存在,比这些关系的现有 Wikidata 事实多 28%。

关键词

引用

@article{arxiv.1807.03656,
  title  = {Enriching Knowledge Bases with Counting Quantifiers},
  author = {Paramita Mirza and Simon Razniewski and Fariz Darari and Gerhard Weikum},
  journal= {arXiv preprint arXiv:1807.03656},
  year   = {2018}
}

备注

16 pages, The 17th International Semantic Web Conference (ISWC 2018)