基于分位数的多元时间序列模糊 C 均值聚类:稳健技术
统计方法学
2021-09-24 v1 机器学习
机器学习
摘要
提出了三种从生成过程角度对多元时间序列进行聚类的稳健方法。这些过程是基于以下方法的模糊 C 均值模型的稳健版本:(i) 分位数互谱密度的估计,以及 (ii) 经典主成分分析。对离群点存在的稳健性通过所谓的度量、噪声和截断方法实现。度量方法在目标函数中引入一种旨在抵消离群点影响的距离度量;噪声方法构建一个预期包含离群序列的人工簇;截断方法剔除数据集中最非典型的序列。所有提出的技术都继承了分位数互谱密度的优良性质,即能够揭示一般类型的依赖关系。一项包含多元线性、非线性和 GARCH 过程的广泛模拟研究结果表明,这些算法在应对离群序列(即表现出与大多数序列不同依赖结构的序列)存在时非常有效,明显优于替代方法。通过涉及金融和环境序列的两个具体应用场景,突出了所提方法的实用性。
引用
@article{arxiv.2109.11027,
title = {Quantile-based fuzzy C-means clustering of multivariate time series: Robust techniques},
author = {Ángel López-Oriona and Pierpaolo D'Urso and José Antonio Vilar and Borja Lafuente-Rego},
journal= {arXiv preprint arXiv:2109.11027},
year = {2021}
}
备注
arXiv admin note: text overlap with arXiv:2109.03728