面向多变量时间序列异常检测的动态奖励缩放:基于VAE的强化学习方法
机器学习
2025-11-18 v1 人工智能
摘要
检测多变量时间序列中的异常现象是监控复杂工业系统的关键任务,其中高维度、有限的标注数据以及传感器之间微妙的依赖关系导致了显著的挑战。本文提出了一种深度强化学习框架,结合变分自编码器(VAE)、基于LSTM的深度Q网络(DQN)、动态奖励调节以及主动学习模块,以统一的方式解决上述问题。主要贡献在于实现了面向多变量时间序列异常检测的动态奖励缩放(DRSMT),证明了每个组件对检测过程的增益。VAE捕获紧凑的潜在表示并降低噪声;DQN实现对异常的自适应、顺序分类;动态奖励调节通过调整重构和分类信号的重要性,在训练期间平衡了探索与开发。此外,主动学习识别最不确定的样本进行标注,减少了对大量人工监督的需求。在两个多变量基准数据集上进行实验,分别包括服务器机器数据集(SMD)和水力分布测试平台(WADI),结果表明本方法在F1分数和AU-PR指标上均优于现有基线方法。这些结果凸显了结合生成式建模、强化学习和选择性监督在实际多变量系统中实现精准、可扩展异常检测的有效性。
引用
@article{arxiv.2511.12351,
title = {Dynamic Reward Scaling for Multivariate Time Series Anomaly Detection: A VAE-Enhanced Reinforcement Learning Approach},
author = {Bahareh Golchin and Banafsheh Rekabdar},
journal= {arXiv preprint arXiv:2511.12351},
year = {2025}
}