基于自监督学习的含缺失值多元时间序列数据聚类方法(SLAC-Time):在 TBI 表型分析中的应用
机器学习
2023-05-30 v2 人工智能
摘要
自监督学习方法为多元时间序列数据聚类提供了一个有前景的方向。然而,真实世界的时间序列数据常包含缺失值,现有方法在聚类前需对缺失值进行插补,这可能引发大量计算与噪声,并导致无效的解释。为应对这些挑战,我们提出一种基于自监督学习的含缺失值多元时间序列数据聚类方法(SLAC-Time)。SLAC-Time 是一种基于 Transformer 的聚类方法,其将时间序列预测作为代理任务,以利用无标签数据并学习更鲁棒的时间序列表示。该方法联合学习神经网络参数与所学表示的簇分配,迭代地使用 K-means 方法对所学表示聚类,随后将所得簇分配作为伪标签来更新模型参数。为评估我们所提方法,我们将其应用于 Transforming Research and Clinical Knowledge in Traumatic Brain Injury(TRACK-TBI)研究中创伤性脑损伤(TBI)患者的聚类与表型分析。实验表明,SLAC-Time 在轮廓系数、Calinski Harabasz 指数、Dunn 指数与 Davies Bouldin 指数方面优于基线 K-means 聚类算法。我们识别出三种在具有临床意义的变量及临床结局(包括 Extended Glasgow Outcome Scale(GOSE)评分、重症监护病房(ICU)住院时长与死亡率)上彼此不同的 TBI 表型。实验显示,SLAC-Time 识别的 TBI 表型可潜在用于开发靶向临床试验与治疗策略。
引用
@article{arxiv.2302.13457,
title = {A Self-Supervised Learning-based Approach to Clustering Multivariate Time-Series Data with Missing Values (SLAC-Time): An Application to TBI Phenotyping},
author = {Hamid Ghaderi and Brandon Foreman and Amin Nayebi and Sindhu Tipirneni and Chandan K. Reddy and Vignesh Subbian},
journal= {arXiv preprint arXiv:2302.13457},
year = {2023}
}
备注
Submitted to the Journal of Biomedical Informatics