临床时间序列数据的特征组数据驱动发现
机器学习
2025-11-12 v1
摘要
临床时间序列数据对患者监护和预测建模至关重要。这些时间序列通常是多变量的,常由来自不同数据源的数百种异构特征组成。基于相似性和与预测任务的相关性对特征进行分组,已显示可提高深度学习架构的性能。然而,仅凭语义知识预先定义这些组对领域专家来说具有挑战性。为此,我们提出一种新方法,通过聚类特征wise 嵌入层的权重来学习特征组。该方法无缝集成到标准监督训练中,并发现直接改善下游在临床相关任务上的性能。我们展示了该方法在合成数据上优于静态聚类方法,并在真实医疗数据上实现了与专家定义的特征组相当的性能。此外,所学得的特征组具有临床可解释性,实现了数据驱动发现与变量之间与任务相关关系。
引用
@article{arxiv.2511.08260,
title = {Data-Driven Discovery of Feature Groups in Clinical Time Series},
author = {Fedor Sergeev and Manuel Burger and Polina Leshetkina and Vincent Fortuin and Gunnar Rätsch and Rita Kuznetsova},
journal= {arXiv preprint arXiv:2511.08260},
year = {2025}
}
备注
Machine Learning for Health (ML4H) 2025 in Proceedings of Machine Learning Research 297