基于符号模式森林确定时间序列数据集的最优聚类数
机器学习
2023-10-03 v1
摘要
聚类算法因其探索性能力以及作为为其他技术铺平道路的初始预处理步骤,是被最广泛使用的数据挖掘方法之一。但计算最优聚类数(记为 k)的问题是此类方法面临的重大挑战之一。在时间序列数据挖掘中,最常用的聚类算法如 k-means 和 k-shape 也需要生成聚类数的真实值。在本工作中,我们扩展了另一种时间序列聚类算法——符号模式森林(Symbolic Pattern Forest, SPF)算法,以确定时间序列数据集的最优聚类数。我们使用 SPF 从数据集中生成聚类,并基于轮廓系数(Silhouette Coefficient,一种用于计算聚类技术优劣的度量)选择最优聚类数。轮廓系数是在由每个时间序列的 SAX 词生成的词袋向量和 tf-idf 向量上计算的。我们在 UCR 档案数据集上测试了我们的方法,迄今为止的实验结果显示相比基线有显著改进。
引用
@article{arxiv.2310.00820,
title = {Determining the Optimal Number of Clusters for Time Series Datasets with Symbolic Pattern Forest},
author = {Md Nishat Raihan},
journal= {arXiv preprint arXiv:2310.00820},
year = {2023}
}