中文

数据库学习:迈向越用越聪明的数据库

数据库 2017-03-30 v2 人工智能

摘要

在当今的数据库中,先前的查询结果很少能有助于回答未来的查询。据我们所知,我们首次在近似查询处理(AQP)语境下改变了这一范式。我们得出如下观察:每个查询的结果都揭示了关于另一个查询结果的某种程度的知识,因为它们的结果源于产生整个数据集的同一底层分布。利用并精炼这些知识应能让我们以更具分析性的方式回答查询,而非读取海量原始数据。此外,处理更多查询应能持续增强我们对底层分布的认知,从而为未来查询带来越来越快的响应时间。我们将这种从过去查询结果中学习的新颖思想称为数据库学习。我们利用最大熵原理来生成查询结果,这些结果在期望上保证比现有的基于样本的近似更准确。在这一思想的赋能下,我们在 Spark SQL 之上构建了一个名为 Verdict 的查询引擎。我们在某大型数据库供应商的一大客户的真实查询迹上进行了广泛实验。结果表明,Verdict 支持其中 73.7% 的查询,在相同准确度水平下,与现有 AQP 系统相比实现了高达 23.0 倍的加速。

关键词

引用

@article{arxiv.1703.05468,
  title  = {Database Learning: Toward a Database that Becomes Smarter Every Time},
  author = {Yongjoo Park and Ahmad Shahab Tajik and Michael Cafarella and Barzan Mozafari},
  journal= {arXiv preprint arXiv:1703.05468},
  year   = {2017}
}

备注

This manuscript is an extended report of the work published in ACM SIGMOD conference 2017