中文

流式张量分解中概念漂移的识别与缓解

机器学习 2018-11-13 v2 机器学习

摘要

张量分解被广泛应用于从社交网络到医疗应用的各种数据挖掘任务中,对于发现数据中的潜在结构或概念极为有用。许多现实应用及其数据具有动态特性。为应对数据的动态性,已有多种在线张量分解算法。这些算法的核心假设是:整个流中潜在概念的数量保持固定。然而事实未必如此。流中每个到达的批次可能具有不同数量的潜在概念,而批次间潜在概念的差异可揭示特定应用中我们发现的结果如何随时间演变与偏离。本文在流式张量分解背景下定义“概念”与“概念漂移”,将其视为整个流中潜在概念可变性的体现。此外,我们提出 SeekAndDestroy 算法,可检测流式张量分解中的概念漂移,并给出对该漂移鲁棒的结果。据我们所知,这是首个研究流式张量分解中概念漂移的工作。我们在展现多种现实漂移的合成数据集上广泛评估 SeekAndDestroy。实验证明了 SeekAndDestroy 在检测概念漂移与缓解其影响方面的有效性,所得结果质量与一次性分解整个张量相当。此外,在真实数据集上,SeekAndDestroy 优于其他流式基线方法,同时发现了新颖有用的成分。

关键词

引用

@article{arxiv.1804.09619,
  title  = {Identifying and Alleviating Concept Drift in Streaming Tensor Decomposition},
  author = {Ravdeep Pasricha and Ekta Gujral and Evangelos E. Papalexakis},
  journal= {arXiv preprint arXiv:1804.09619},
  year   = {2018}
}

备注

16 Pages, Accepted at ECML-PKDD 2018