比较智能表计时间序列的聚类方法:探讨数据集属性对性能的影响
应用统计
2025-04-22 v3
摘要
智能表计的广泛采用为监测能源消耗生成了大量高分辨率时间序列数据,但这些数据仍未得到充分利用。尽管聚类方法已成为从智能表计时间序列(SMTS)数据中进行数据挖掘的基本工具,但在众多比较研究后,选择合适的聚类方法仍然具有挑战性。这些研究常常采用问题的方法论,仅考虑有限范围的方法,经常忽视更广泛的时间序列聚类文献中有价值的方法。因此,它们难以为从事自身聚类方法设计的实践者提供可靠的指导。本文提出了一种针对SMTS聚类方法的全面比较框架,使用以专家知识为导向的合成数据集,强调峰值消费行为作为基本聚类概念。通过分阶段的方法,我们首先使用留样本分类评估了31种距离度量和8种表示方法,然后检查更合适的方法与11种聚类算法的组合。我们进一步评估了这些组合对关键数据集属性的鲁棒性,这些属性影响实际数据集上的聚类性能,包括聚类平衡性、噪声以及异常值的存在。我们的结果发现,能够容纳局部时间偏移同时保持振幅敏感性的方法,尤其是动态时间变形(Dynamic Time Warping)和k滑移距离(k-sliding distance),在比较传统方法方面表现一致优于。除其他关键发现外,我们确定当这些方法与k中心或使用Wards链接法的层次聚类结合时,这些方法在不同数据集特征下表现出一致的鲁棒性...
引用
@article{arxiv.2412.02026,
title = {Comparing Clustering Approaches for Smart Meter Time Series: Investigating the Influence of Dataset Properties on Performance},
author = {Luke W. Yerbury and Ricardo J. G. B. Campello and G. C. Livingston and Mark Goldsworthy and Lachlan O'Neil},
journal= {arXiv preprint arXiv:2412.02026},
year = {2025}
}