中文

大数据与跨文档共指消解:现状与未来机遇

计算与语言 2013-11-19 v1 分布式、并行与集群计算 信息检索

摘要

信息抽取 (IE) 是从非结构化/半结构化机器可读文档中自动提取结构化信息的任务。在各种 IE 任务中,从日益增长的数据量中提取可操作的情报关键取决于跨文档共指消解 (CDCR)——即识别跨多个文档中指代同一底层实体的实体提及的任务。最近,PB/TB 量级的文档数据集给执行有效的 CDCR 带来了许多挑战,例如扩展到大量提及以及表示能力有限。分析此类数据集的问题被称为“大数据”。本文旨在让读者了解 CDCR 过程中的核心概念、子任务及最新技术现状。我们评估了现有的 CDCR 子任务工具/技术,并突出了其中各自面临的大数据挑战,以帮助读者识别需要进一步研究的重要和突出问题。最后,我们给出结论并讨论未来工作的可能方向。

关键词

引用

@article{arxiv.1311.3987,
  title  = {Big Data and Cross-Document Coreference Resolution: Current State and Future Opportunities},
  author = {Seyed-Mehdi-Reza Beheshti and Srikumar Venugopal and Seung Hwan Ryu and Boualem Benatallah and Wei Wang},
  journal= {arXiv preprint arXiv:1311.3987},
  year   = {2013}
}