中文

基于时序核化自编码器学习含缺失数据的多变量时间序列表示

神经与进化计算 2019-07-17 v2

摘要

学习多变量时间序列(MTS)的压缩表示有助于在存在噪声和冗余信息以及大量变量和时间步的情况下进行数据分析。然而,经典的降维方法针对向量数据设计,无法显式处理缺失值。在本工作中,我们提出了一种基于循环神经网络的新型自编码器架构,以生成 MTS 的压缩表示。所提模型可处理变长输入,并专门设计用于处理缺失数据。我们的自编码器学习定长向量表示,其成对相似性与输入空间中运算并处理缺失值的核函数对齐。这允许学习良好的表示,即使在存在大量缺失数据的情况下。为展示所提方法的有效性,我们在多个分类任务(包括涉及医疗数据的任务)中评估所学表示的质量,并与其他降维方法进行比较。随后,我们基于所提架构设计了两个框架:一个用于缺失数据填补,另一个用于单类分类。最后,我们分析了在何种情况下带有循环层的自编码器能比前馈架构学习更好的 MTS 压缩表示。

关键词

引用

@article{arxiv.1805.03473,
  title  = {Learning representations for multivariate time series with missing data using Temporal Kernelized Autoencoders},
  author = {Filippo Maria Bianchi and Lorenzo Livi and Karl Øyvind Mikalsen and Michael Kampffmeyer and Robert Jenssen},
  journal= {arXiv preprint arXiv:1805.03473},
  year   = {2019}
}