中文

模糊滞后数据的共聚类

人工智能 2014-05-16 v2

摘要

本文聚焦于挖掘由数据对象间模糊滞后关系所表征的模式。此类调节机制在现实场景中十分常见,出现在金融、基因表达、神经科学、人群及集体运动等诸多领域。挖掘此类模式不仅有助于理解领域内对象间的关系,还能辅助预测其未来行为。对于该问题的大多数有趣变体而言,寻找最优模糊滞后共聚类是一个 NP 完全问题。因此,我们提出了一种用于挖掘模糊滞后共聚类的多项式时间蒙特卡洛近似算法。我们证明,对于任意数据矩阵,该算法能以固定概率挖掘出一个模糊滞后共聚类,其包含最优模糊滞后共聚类,且列开销最大为 2 倍,行开销为零。此外,该算法能够处理噪声、负相关、缺失值及重叠模式。我们使用人工数据集和真实数据集对该算法进行了广泛评估。结果不仅证实了该算法高效挖掘相关且准确的模糊滞后共聚类的能力,也阐明了在滞后模式模型中引入模糊性的重要性。

关键词

引用

@article{arxiv.1402.1500,
  title  = {Co-clustering of Fuzzy Lagged Data},
  author = {Eran Shaham and David Sarne and Boaz Ben-Moshe},
  journal= {arXiv preprint arXiv:1402.1500},
  year   = {2014}
}

备注

Under consideration for publication in Knowledge and Information Systems. The final publication is available at Springer via http://dx.doi.org/10.1007/s10115-014-0758-7