中文

时间衰减数据流上的改进算法

数据结构与算法 2019-07-18 v1

摘要

在数据流的时间衰减模型中,底层数据集的元素顺序到达,且较新到达的元素更为重要。处理大规模数据集的常用方法是维护一个\emph{核心集}(coreset),即已处理数据的简洁摘要,可近似恢复预定查询。我们提供一个通用框架,接收任意离线核心集并给出多项式时间衰减函数的时间衰减核心集。我们还考虑了 kk-中位数聚类中的指数时间衰减模型,给出了利用在线设施选址算法的常数因子近似算法。我们的算法存储 O(klog(hΔ)+h)\mathcal{O}(k\log(h\Delta)+h) 个点,其中 hh 为衰减函数的半衰期,Δ\Delta 为数据集的纵横比。我们的技术也扩展到 kk-均值聚类和 MM-估计。

关键词

引用

@article{arxiv.1907.07574,
  title  = {Improved Algorithms for Time Decay Streams},
  author = {Vladimir Braverman and Harry Lang and Enayat Ullah and Samson Zhou},
  journal= {arXiv preprint arXiv:1907.07574},
  year   = {2019}
}

备注

To appear at APPROX 2019