中文

测量数据集的独立性

数据结构与算法 2009-03-03 v1 数据库 信息检索 性能

摘要

数据流模型代表了一种场景,其中用亚线性内存近似成对或kk阶独立性具有相当的重要性。在流模型中,联合分布由kk元组的流给出,目标是测试在整个流上测量的分量之间的相关性。在流模型中,Indyk和McGregor (SODA 08) 最近在测量成对独立性方面给出了令人兴奋的新结果。Indyk和McGregor的方法在流模型中,在联合分布与乘积分布之间的统计距离下提供了logn\log{n}近似。Indyk和McGregor将其主要开放问题留给了改进统计距离度量的logn\log n近似。在本文中,我们解决了Indyk和McGregor提出的关于成对独立性统计距离的主要开放问题,并将该结果推广到任意常数kk。特别地,我们提出了一种算法,该算法计算由kk元组流定义的联合分布与乘积分布之间统计距离的(ϵ,δ)(\epsilon, \delta)近似。我们的算法需要O((1ϵlog(nmδ))(30+k)k)O(({1\over \epsilon}\log({nm\over \delta}))^{(30+k)^k})的内存和单次数据流遍历。

关键词

引用

@article{arxiv.0903.0034,
  title  = {Measuring Independence of Datasets},
  author = {Vladimir Braverman and Rafail Ostrovsky},
  journal= {arXiv preprint arXiv:0903.0034},
  year   = {2009}
}