中文

MISS:为近似分析寻找最优样本量

数据库 2018-07-31 v1

摘要

如今,基于采样的近似查询处理 (AQP) 被广泛视为在大数据分析中实现交互性的一种有前景的途径。构建此类 AQP 系统,针对给定误差约束找到查询的最小样本量(统称为样本量优化 (SSO)),是一个本质且未解决的问题。理想情况下,解决 SSO 问题的目标是同时实现统计准确性、计算效率和广泛适用性。现有方法要么对查询的统计性质做理想化假设,要么完全忽视它们。这可能导致仅过度强调三个目标之一而忽略其他。为克服这些局限,我们首先仔细考察常见分析查询共享的统计性质。然后,基于这些性质,我们提出描述样本量与查询近似误差之间关系的线性模型,称为误差模型。接着,我们提出模型引导的迭代样本选择 (MISS) 框架来通用地解决 SSO 问题。此后,基于 MISS 框架,我们提出一种具体算法,称为 L2L^2Miss,以在 L2L^2 范数误差度量下寻找最优样本量。此外,我们扩展 L2L^2Miss 算法以处理其他误差度量。最后,我们从理论和经验上表明,L2L^2Miss 算法及其扩展在相当广泛的分析查询范围内达到了令人满意的准确性和效率。

关键词

引用

@article{arxiv.1807.11054,
  title  = {MISS: Finding Optimal Sample Sizes for Approximate Analytics},
  author = {Xuebin Su and Hongzhi Wang and Jianzhong Li and Hong Gao},
  journal= {arXiv preprint arXiv:1807.11054},
  year   = {2018}
}