中文

时间序列聚类的弹性距离函数综述与评估

机器学习 2024-10-18 v2

摘要

时间序列聚类是在无标签情况下对时间序列数据进行分组的行为。对时间序列进行聚类的算法可分为两类:采用时间序列专用距离度量的算法;以及从时间序列中提取特征的算法。两种方法通常都依赖传统聚类算法,如 kk-means。我们的关注点在于采用弹性距离度量(即在度量距离时执行某种重对齐的距离)的基于距离的时间序列。我们描述了九种常用弹性距离度量,并将其与 k-means 和 k-medoids 聚类的性能进行比较。我们的发现令人惊讶。最流行的技术——动态时间规整(DTW)——在 k-means 下表现不如欧氏距离,且即便经过调参也不更优。使用 k-medoids 而非 k-means 改善了所有九种距离度量的聚类效果。DTW 在 k-medoids 下并不显著优于欧氏距离。一般而言,结合编辑与规整的距离度量表现更好,且其中一种距离度量——移动-分割-合并(MSM)法——是本研究中最优的度量。我们还与使用基于质心平均(DBA)的 DTW 聚类进行比较。我们发现 DBA 确实改善了 DTW k-means,但标准 DBA 仍劣于使用 MSM。我们的结论是推荐 MSM 配 k-medoids 作为基于弹性距离度量聚类时间序列的基准算法。我们在 aeon 工具包中提供了实现、结果以及于相关 GitHub 仓库复现结果的指南。

关键词

引用

@article{arxiv.2205.15181,
  title  = {A Review and Evaluation of Elastic Distance Functions for Time Series Clustering},
  author = {Chris Holder and Matthew Middlehurst and Anthony Bagnall},
  journal= {arXiv preprint arXiv:2205.15181},
  year   = {2024}
}