多变量时间序列的可扩展数值嵌入:增强医疗数据表示学习
机器学习
2024-05-28 v1 人工智能
摘要
多变量时间序列(MTS)数据在非规则和异步采样时,常常出现大量缺失值。传统的MTS分析方法倾向于依赖基于时间戳的时间嵌入,这需要后续插补,但这些插补值往往与真实值存在显著偏差,从而影响预测准确性。此外,这些方法通常无法为训练集中很少出现甚至缺失的值提供鲁棒的初始嵌入,对模型泛化能力构成重大挑战。针对这些挑战,我们提出了可扩展数值嵌入(SCANE),一种新颖的框架,将每个特征值视为独立标记,有效避免了插补的需要。SCANE通过可扩展嵌入机制正则化不同特征嵌入的特性并增强表示学习。将SCANE与Transformer编码器架构结合,我们开发了可扩展数值嵌入Transformer(SUMMIT),旨在为具有普遍缺失条目的MTS提供精确的预测输出。我们在三个具有高缺失值频率的不同电子健康记录(EHR)数据集上进行的实验验证证实,SUMMIT在解决类似挑战方面优于当前最先进的方法。这些结果证实了SCANE和SUMMIT的有效性,强调了它们在广泛的MTS数据分析任务中的潜在适用性。
引用
@article{arxiv.2405.16557,
title = {Scalable Numerical Embeddings for Multivariate Time Series: Enhancing Healthcare Data Representation Learning},
author = {Chun-Kai Huang and Yi-Hsien Hsieh and Ta-Jung Chien and Li-Cheng Chien and Shao-Hua Sun and Tung-Hung Su and Jia-Horng Kao and Che Lin},
journal= {arXiv preprint arXiv:2405.16557},
year = {2024}
}