中文

多输入变分自编码器用于异构数据中的异常检测

人工智能 2025-01-15 v1 机器学习 机器学习

摘要

异常检测(AD)在AI应用中发挥着关键作用,例如在分类和网络安全中的入侵/威胁检测。然而,大多数现有方法面临由非独立同分布(non-IID)数据所导致的特征子集之间的异构性挑战。我们提出了一种 novel 神经网络模型,称为用于异常检测的多输入自编码器(MIAEAD),以解决此问题。MIAEAD 为数据样本的每个特征子集分配一个异常得分,以指示其被异常的可能性。这通过使用其子编码器的重构误差作为异常得分来实现。所有子编码器随后使用无监督学习方式同时训练,以确定特征子集的异常得分。计算 MIAEAD 的最终 AUC,用于每个子数据集,选取其中在子数据集中获得的最大 AUC。为充分利用对正常数据分布建模以识别生成模型中的异常,我们发展了一种 novel 神经网络架构/模型,称为多输入变分自编码器(MIVAE)。MIVAE 可通过其子编码器处理特征子集,然后在潜在空间中学习正常数据的分布。这使 MIVAE 能够识别偏离所学分布的异常。我们理论上证明,由提议的 MIVAE 获取的正常样本与异常样本之间平均异常得分之差,大于变分自编码器(VAEAD)之差,导致 MIVAE 的 AUC 更高。在八个真实世界异常数据集上的大量实验表明,MIAEAD 和 MIVAE 在常规方法和最先进的无监督模型方面性能优越,AUC 分数提升最高可达 6%。或者,MIAEAD 和 MIVAE 在基于系数变异(CV)得分评估的特征子集异构性较低时,AUC 得分也很高。

关键词

引用

@article{arxiv.2501.08149,
  title  = {Multiple-Input Variational Auto-Encoder for Anomaly Detection in Heterogeneous Data},
  author = {Phai Vu Dinh and Diep N. Nguyen and Dinh Thai Hoang and Quang Uy Nguyen and Eryk Dutkiewicz},
  journal= {arXiv preprint arXiv:2501.08149},
  year   = {2025}
}

备注

16 pages