中文

R*-Grove:面向大规模数据集的均衡空间划分

数据库 2020-07-24 v1 分布式、并行与集群计算 数据结构与算法

摘要

大空间数据的快速增长促使研究界开发了若干大空间数据系统。无论其架构如何,所有这些系统的一项基本需求是在机器间高效地空间划分数据。大空间划分的核心挑战在于构建高空间质量的划分,同时通过提供负载均衡的划分来利用分布式处理模型。以往关于大空间划分的工作是原样复用现有索引搜索树,例如 R 树族、STR、Kd 树和四叉树,通过对输入样本构建临时树并将其叶节点用作划分边界。然而,我们在本文中表明,这些技术均未能完全应对上述挑战。本文提出一种称为 R*-Grove 的新型划分方法,其能将非常大的空间数据集划分为具有高空间质量、优异负载均衡和块利用率的划分。这一良好特性使 R*-Grove 在空间查询处理中优于现有技术。R*-Grove 可轻松集成到任意大数据平台(如 Apache Spark 或 Apache Hadoop)中。我们的实验表明,R*-Grove 在大空间数据系统的现有划分技术中表现更优。随着所提工作均以开源形式公开可用,我们期望 R*-Grove 将被学界采纳以更好地服务于大空间数据研究。

关键词

引用

@article{arxiv.2007.11651,
  title  = {R*-Grove: Balanced Spatial Partitioning for Large-scale Datasets},
  author = {Tin Vu and Ahmed Eldawy},
  journal= {arXiv preprint arXiv:2007.11651},
  year   = {2020}
}

备注

29 pages, to be published in Frontiers in Big Data