基于负采样的可解释多维多模态异常检测及其在设备故障识别中的应用
信号处理
2020-07-21 v1 机器学习
摘要
复杂设备每日联网并持续产生大量的多维状态测量数据流。这些设备常依据外部条件(昼/夜、占用/空置等)运行于不同模式,为防止系统完全或部分中断,我们希望尽早识别设备何时开始偏离正常模式运行。遗憾的是,利用规则或有监督机器学习预测故障往往不切实际或不可能,因为故障模式过于复杂、设备过于新颖而难以在特定环境中充分刻画,或环境变化使设备陷入不可预测状态。我们提出一种无监督异常检测方法,从正类观测样本构造负样本,并训练分类器区分正负样本。利用压缩原理(Contraction Principle),我们解释了此类分类器为何能在正常与异常区域间建立合适的决策边界,并展示积分梯度(Integrated Gradients)如何将异常归因于异常状态向量中的特定变量。我们已证明,采用随机森林或神经网络分类器的负采样在以下数据上的 AUC 分数显著优于孤立森林(Isolation Forest)、单类支持向量机(One Class SVM)和深度单类支持向量描述(Deep SVDD):(a) 维度介于 2 至 128、含 1、2 和 3 种模式、带或不带噪声维度的合成数据集;(b) 四个标准基准数据集;(c) 来自真实气候控制设备的多维多模态数据集。最后,我们描述了采用神经网络分类器的负采样如何成功大规模部署,用于实时预测谷歌 145 栋办公大楼中超过 15,000 台气候控制与电力计量设备的故障。
引用
@article{arxiv.2007.10088,
title = {Interpretable, Multidimensional, Multimodal Anomaly Detection with Negative Sampling for Detection of Device Failure},
author = {John Sipple},
journal= {arXiv preprint arXiv:2007.10088},
year = {2020}
}
备注
Open source submission: https://github.com/google/madi