TadGAN:基于生成对抗网络的时间序列异常检测
机器学习
2020-11-17 v3 机器学习
摘要
时间序列异常可提供与各领域关键情境相关的信息,从金融、航空航天到 IT、安全与医疗领域。然而,由于异常的定义模糊以及所述数据常缺乏标签且具高度复杂的时间相关性,检测时间序列数据中的异常尤为困难。当前最先进的无监督机器学习异常检测方法存在可扩展性与可移植性问题,并可能有较高误报率。在本文中,我们提出 TadGAN,一种构建于生成对抗网络(GANs)之上的无监督异常检测方法。为捕捉时间序列分布的时间相关性,我们使用 LSTM 循环神经网络作为生成器与判别器的基础模型。TadGAN 以循环一致性损失进行训练,以实现有效的时间序列数据重建。我们进一步提出若干计算重建误差的新方法,以及不同结合重建误差与判别器输出以计算异常分数的方法。为展示我们方法的性能与泛化能力,我们测试了多种异常评分技术并报告最适用者。我们在来自 NASA、Yahoo、Numenta、Amazon 与 Twitter 等多个知名来源的 11 个数据集上将我们的方法与 8 种基线异常检测方法比较。结果表明我们的方法能有效检测异常,并在大多数情况下(11 个中的 6 个)优于基线方法。值得注意的是,我们的方法在所有数据集上拥有最高的平均 F1 分数。我们的代码是开源的,并可作为基准测试工具使用。
引用
@article{arxiv.2009.07769,
title = {TadGAN: Time Series Anomaly Detection Using Generative Adversarial Networks},
author = {Alexander Geiger and Dongyu Liu and Sarah Alnegheimish and Alfredo Cuesta-Infante and Kalyan Veeramachaneni},
journal= {arXiv preprint arXiv:2009.07769},
year = {2020}
}
备注
Alexander Geiger and Dongyu Liu contributed equally. To appear in the proceedings of IEEE International Conference on Big Data