中文

突破 Top-k 壁垒:深入挖掘深网数据库

数据库 2012-08-21 v1

摘要

大量 Web 数据库仅能通过专有的表单式界面访问,这要求用户通过输入少数属性的期望值来查询系统。此类界面强制执行的一个关键限制是 top-k 输出约束——即当存在大量匹配元组时,网站通常根据专有排序函数优先选择并返回其中少数 (top-k) 元组。由于大多数 Web 数据库所有者将kk设置为较小的值,top-k 输出约束阻碍了许多有趣的第三方服务 (例如 mashup) 在现实世界 Web 数据库上的开发。在本文中,我们考虑了“深入挖掘”此类 Web 数据库这一新问题。我们的主要贡献是元算法 GetNext,它仅利用 Web 数据库的限制性界面,无需任何关于其排序函数的先验知识,即可从隐藏 Web 数据库中检索下一个排序元组。该算法随后可以被迭代调用,以检索任意数量的顶部排序元组。我们开发了基于生成和执行多个重构查询并从其返回结果中推断下一个排序元组的原理性高效算法。我们提供了算法的理论分析,以及在合成数据库和真实数据库上的广泛实验结果,展示了我们技术的有效性。

关键词

引用

@article{arxiv.1208.3876,
  title  = {Digging Deeper into Deep Web Databases by Breaking Through the Top-k Barrier},
  author = {Saravanan Thirumuruganathan and Nan Zhang and Gautam Das},
  journal= {arXiv preprint arXiv:1208.3876},
  year   = {2012}
}

备注

12 pages, 11 figures