中文

流式图命名实体消歧方法的基准测试

计算与语言 2014-07-15 v1 信息检索

摘要

命名实体消歧 (NED) 是处理自然语言文本应用的核心任务。假设我们有一个基于图的知识库(随后称为知识图谱),其中节点代表各种现实世界实体,如人物、地点、组织和概念。给定社交媒体流和网页等数据源,实体链接是将数据中提取的命名实体映射到知识图谱中现有实体的任务。由于多种原因,这是一项 inherently 困难的任务。几乎所有这些数据源的生成都没有正式的本体论;输入的无结构化性质、有限的上下文以及当多个实体映射到同一名称时涉及的歧义,使得这项任务变得艰难。本报告考察了采用两种不同方法的两个最先进系统:基于图的实体精确在线消歧 (AIDA) 和挖掘证据命名实体消歧 (MENED),后者采用统计推断方法。我们使用 2011 年 NIST 文本分析会议 (TAC) 知识库填充 (KBP) 轨道提供的数据集和查询来比较这两种方法。本报告首先概述了各自的方法,随后详细描述了实验设置,最后总结了基准测试 exercise 的发现。

关键词

引用

@article{arxiv.1407.3751,
  title  = {Benchmarking Named Entity Disambiguation approaches for Streaming Graphs},
  author = {Sutanay Choudhury and Chase Dowling},
  journal= {arXiv preprint arXiv:1407.3751},
  year   = {2014}
}