中文

SE-shapelets:使用代表性 Shapelets 的时间序列半监督聚类

机器学习 2023-11-16 v2

摘要

Shapelets 通过使用局部特征(子序列)来区分时间序列,在时间序列聚类中极具前景。现有的时间序列聚类方法可能无法捕获具有代表性的 shapelets,因为它们是从大量无信息子序列的池中发现 shapelets,从而导致聚类准确率较低。本文提出了一种使用代表性 Shapelets 的时间序列半监督聚类(SE-Shapelets)方法,该方法利用少量带标签和传播的伪标签时间序列来帮助发现代表性 shapelets,从而提高聚类准确率。在 SE-Shapelets 中,我们提出了两种技术来发现代表性 shapelets,以实现有效的时间序列聚类。1)一条显著子序列链(SSCSSC),可以提取带标签/伪标签时间序列的显著子序列(作为候选 shapelets),这有助于从池中移除大量无信息的子序列。2)一种线性判别选择(LDSLDS)算法,用于识别能够捕获不同类别时间序列代表性局部特征的 shapelets,以便于聚类。在 UCR 时间序列数据集上的实验表明,SE-shapelets 发现了代表性 shapelets,并取得了比同类半监督时间序列聚类方法更高的聚类准确率。

关键词

引用

@article{arxiv.2304.03292,
  title  = {SE-shapelets: Semi-supervised Clustering of Time Series Using Representative Shapelets},
  author = {Borui Cai and Guangyan Huang and Shuiqiao Yang and Yong Xiang and Chi-Hung Chi},
  journal= {arXiv preprint arXiv:2304.03292},
  year   = {2023}
}