中文

滑动窗口上的高效代表性子集选择

数据结构与算法 2018-09-05 v2 机器学习 社会与信息网络

摘要

代表性子集选择(RSS)是用户从海量数据集中获取洞察的重要工具。现有文献将 RSS 建模为次模最大化问题,以捕捉所选子集代表性的“收益递减”特性,但通常仅具有单一约束(例如基数约束),这限制了其在许多实际问题中的应用。为了捕捉数据时效性问题并支持不同类型的约束,我们将数据流中的动态 RSS 形式化为在滑动窗口上受一般 d-背包约束的次模函数最大化问题(SMDK)。我们为 SMDK 提出了一个 KnapWindow 框架(KW)。KW 利用用于仅追加流中 SMDK 的 KnapStream 算法(KS)作为子程序。它在滑动窗口上维护一个检查点序列和 KS 实例。理论上,KW 对于 SMDK 是 (1-ε)/(1+d) 近似的。此外,我们提出了一个 KnapWindowPlus 框架(KW⁺)来改进 KW。KW⁺ 构建了一个索引 SubKnapChk 来管理检查点和 KS 实例。SubKnapChk 在某个检查点可以被其后继者近似时将其删除。通过保留更少的检查点,KW⁺ 实现了比 KW 更高的效率,同时仍能为 SMDK 保证一个 (1-ε')/(2+2d) 近似解。最后,我们在真实世界数据集上评估了 KW 和 KW⁺ 的效率和解的质量。实验结果表明,KW 在滑动窗口上为 SMDK 提供的解,相比批量基线实现了超过两个数量级的加速,并保持了高质量的解。KW⁺ 的运行速度比 KW 进一步快 5-10 倍,同时提供效用相当甚至更好的解。

关键词

引用

@article{arxiv.1706.04764,
  title  = {Efficient Representative Subset Selection over Sliding Windows},
  author = {Yanhao Wang and Yuchen Li and Kian-Lee Tan},
  journal= {arXiv preprint arXiv:1706.04764},
  year   = {2018}
}

备注

26 pages, 9 figures, to appear in IEEE Transactions on Knowledge and Data Engineering (TKDE). 2018