数据立方体:一种泛化分组、交叉表和小计的关系聚合算子
数据库
2007-05-23 v1
摘要
数据分析应用通常跨多个维度聚合数据,以寻找异常或不寻常的模式。SQL 聚合函数和 GROUP BY 算子产生零维或一维聚合。应用需要这些算子的 N 维泛化。本文定义了该算子,称为数据立方体或简称立方体。立方体算子泛化了大多数报表生成工具中的直方图、交叉表、上卷、下钻和小计构造。其新颖之处在于立方体是关系。因此,立方体算子可以嵌入到更复杂的非过程化数据分析程序中。立方体算子将 N 个聚合属性中的每一个视为 N 维空间的一个维度。特定属性值集合的聚合是该空间中的一个点。这些点的集合构成了一个 N 维立方体。超聚合是通过将 N 维立方体聚合到更低维度空间来计算的。本文 (1) 解释了立方体和上卷算子,(2) 展示了它们如何融入 SQL,(3) 解释了用户如何为立方体定义新的聚合函数,以及 (4) 讨论了计算立方体的高效技术。这些特性中的许多正被添加到 SQL 标准中。
引用
@article{arxiv.cs/0701155,
title = {Data Cube: A Relational Aggregation Operator Generalizing Group-By, Cross-Tab, and Sub-Totals},
author = {Jim Gray and Surajit Chaudhuri and Adam Bosworth and Andrew Layman and Don Reichart and Murali Venkatrao and Frank Pellow and Hamid Pirahesh},
journal= {arXiv preprint arXiv:cs/0701155},
year = {2007}
}