关于相似性分组关系数据库算子的与顺序无关语义
数据库
2014-12-16 v1
摘要
相似性分组(简称 SGB)作为一种关系数据库算子被提出,以满足新兴数据库应用的需求。文献中已提出许多扩展 SQL 的 SGB 算子,例如一维空间中的相似性算子。这些算子具有不同的语义。取决于这些算子的实现方式,某些实现可能导致不同的数据分组。因此,如果将 SQL 代码从一个数据库系统移植到另一个系统,不能保证代码会产生相同的结果。在本文中,我们研究了多维空间中关系相似性分组算子的各种语义。我们定义了与顺序无关的 SGB 算子类,无论输入数据的呈现顺序如何,它们都能产生相同的结果。利用借用于图论的区间图概念,我们证明了对于某些 SGB 算子,存在与顺序无关的实现。对于每个此类算子,我们提供了一种与顺序无关的示例算法。此外,我们证明了对于其他 SGB 算子,不存在与顺序无关的实现,因此这些 SGB 算子定义不当,不应在扩展 SQL 以实现相似性分组时采用。在本文中,我们引入了一种名为 SGB-All 的 SGB 算子,用于利用相似性对多维数据进行分组。SGB-All 形成的组满足:当且仅当数据项(设为 O)与组(设为 G)中所有其他数据项的距离在用户定义的阈值内时,O 属于 G。换言之,SGB-All 中的每个组在多维空间中形成一个邻近数据项的团(clique)。我们证明了 SGB-All 是与顺序无关的,即对于每个选项,至少存在一种算法独立于输入数据的呈现顺序。
引用
@article{arxiv.1412.4303,
title = {On Order-independent Semantics of the Similarity Group-By Relational Database Operator},
author = {Mingjie Tang and Ruby Y. Tahboub and Walid G. Aref and Qutaibah M. Malluhi and Mourad Ouzzani},
journal= {arXiv preprint arXiv:1412.4303},
year = {2014}
}
备注
13 pages