中文

SOMTimeS:用于时间序列聚类的自组织映射及其在重病对话中的应用

机器学习 2021-08-27 v1

摘要

对能够聚类和分析大型时间序列数据集的可扩展算法的需求日益增长。Kohonen 自组织映射是一种无监督人工神经网络,用于可视化和聚类复杂数据、降低数据维度以及选择有影响力的特征。与所有聚类方法一样,SOM 需要输入数据(在本工作中为时间序列)之间的相似性度量。动态时间规整就是这样一种度量,并且由于其能够适应时间序列对齐时的畸变而成为表现优异的方法。尽管 DTW 被用于聚类,但在实践中它受到限制,因为其运行时复杂度与时间序列数据的长度呈二次关系。为了解决这个问题,我们提出了一种新的基于 DTW 的聚类方法,称为 SOMTimeS(用于时间序列的自组织映射),它比其他基于 DTW 的聚类算法具有更好的可扩展性和更快的运行速度,并且具有相似的性能准确度。SOMTimeS 的计算性能源于其在 SOM 训练阶段修剪不必要的 DTW 计算的能力。我们还为 K-means 实现了类似的修剪策略,以便与表现优异的聚类算法之一进行比较。我们在加州大学河滨分校分类档案库的 112 个基准时间序列数据集上评估了修剪有效性、准确度、执行时间和可扩展性。我们表明,在相似准确度下,SOMTimeS 和 K-means 的平均加速比为 1.8 倍;然而,具体比率因数据集而异,在 1 倍到 18 倍之间。SOMTimeS 和 K-means 分别修剪了 43% 和 50% 的总 DTW 计算。我们将 SOMtimeS 应用于作为大型医疗队列研究中患者与临床医生重病对话的一部分而收集的自然语言对话数据,以展示该算法在处理复杂时间序列现象方面的效用。

关键词

引用

@article{arxiv.2108.11523,
  title  = {SOMTimeS: Self Organizing Maps for Time Series Clustering and its Application to Serious Illness Conversations},
  author = {Ali Javed and Donna M. Rizzo and Byung Suk Lee and Robert Gramling},
  journal= {arXiv preprint arXiv:2108.11523},
  year   = {2021}
}

备注

36 pages