WebSets:利用无监督信息抽取从 Web 中提取实体集
机器学习
2013-07-02 v1 计算与语言
信息检索
摘要
我们描述了一种开放域信息抽取方法,用于从 HTML 语料库中提取概念 - 实例对。大多数早期解决该问题的方法依赖于结合分布相似术语的聚类与利用 Hearst 模式获得的概念 - 实例对。相比之下,我们的方法依赖于一种新颖的聚类方法,即对 HTML 表格中发现的术语进行聚类,然后利用 Hearst 模式为这些聚类分配概念名称。该方法可高效应用于大型语料库,在多个数据集上的实验结果表明,我们的方法能够准确提取大量概念 - 实例对。
引用
@article{arxiv.1307.0261,
title = {WebSets: Extracting Sets of Entities from the Web Using Unsupervised Information Extraction},
author = {Bhavana Dalvi and William W. Cohen and Jamie Callan},
journal= {arXiv preprint arXiv:1307.0261},
year = {2013}
}
备注
10 pages; International Conference on Web Search and Data Mining 2012