中文

AnoShift:面向无监督异常检测的分布偏移基准

机器学习 2023-04-04 v4

摘要

分析数据的分布偏移是当今机器学习(ML)中一个日益增长的研究方向,催生了新兴的基准,专注于为研究 ML 模型的泛化特性提供合适场景。现有基准聚焦于监督学习,据我们所知,尚无针对无监督学习的基准。因此,我们引入了一个数据随时间偏移的无监督异常检测基准,构建于 Kyoto-2006+(一个用于网络入侵检测的流量数据集)之上。此类数据符合输入分布发生偏移的前提:其覆盖大时间跨度(1010 年),并随时间自然发生变化(例如用户修改其行为模式、软件更新)。我们首先通过基础的单特征分析、t-SNE 以及用于度量年份间整体分布距离的最优传输方法,凸显数据的非平稳特性。接下来,我们提出 AnoShift,一种将数据划分为 IID、NEAR 和 FAR 测试集的协议。我们使用从经典方法到深度学习的多种模型,验证了性能随时间的退化。最后,我们表明,通过承认分布偏移问题并恰当应对,相比假设独立同分布数据的经典训练,性能可得到提升(平均而言,我们的方法最高提升 3%3\%)。数据集与代码见 https://github.com/bit-ml/AnoShift/。

关键词

引用

@article{arxiv.2206.15476,
  title  = {AnoShift: A Distribution Shift Benchmark for Unsupervised Anomaly Detection},
  author = {Marius Dragoi and Elena Burceanu and Emanuela Haller and Andrei Manolache and Florin Brad},
  journal= {arXiv preprint arXiv:2206.15476},
  year   = {2023}
}