CrowdGather:结构化域上的实体抽取
数据库
2015-02-25 v1
摘要
众包实体抽取常用于为许多应用获取数据,包括推荐系统、聚合列表和目录的构建以及知识库构建。当前的解决方案侧重于使用单一查询进行实体抽取,例如在汇编所有餐厅列表时仅使用“再给我一家餐厅”。由于人力成本高昂,专注于单一查询的解决方案可能极不切实际。在本文中,我们利用实体抽取通常关注*结构化域*(即由一组属性描述的域,每个属性可能呈现层次结构)这一事实。给定这样一个域,我们启用更丰富的查询空间,例如“再给我一家位于曼哈顿提供外卖服务的摩洛哥餐厅”。自然地,启用更丰富的查询空间会带来一系列问题,尤其是许多查询返回空结果。我们开发了新的统计工具,使我们能够在信息极少甚至没有信息的情况下推理发出*额外查询*的收益,并展示如何利用数据域不同点的查询结果之间的重叠来获得准确的收益估计。我们将大域上的*预算实体抽取*问题转化为一个自适应优化问题,旨在最大化抽取实体的数量,同时最小化整体抽取成本。我们在合成数据集和真实世界数据集上评估了我们的技术,结果表明在相同预算下,我们的方法比竞争方法的产出高达 4 倍。
引用
@article{arxiv.1502.06823,
title = {CrowdGather: Entity Extraction over Structured Domains},
author = {Theodoros Rekatsinas and Amol Deshpande and Aditya Parameswaran},
journal= {arXiv preprint arXiv:1502.06823},
year = {2015}
}