中文

基于多示例学习检测序列现实世界数据集中的异常

机器学习 2022-10-05 v1

摘要

在现实世界数据集上检测异常仍是一项具有挑战性的任务。数据标注是密集的人力劳动问题,尤其在序列数据集中,异常的起止时间未知。因此,从现实世界过程收集的数据往往大量无标注或含有不准确标签。这些特性对基于监督学习的异常检测技术的应用提出了挑战。相比之下,多示例学习 (MIL) 在训练集标签知识不完备的问题上已被证明有效,这主要得益于包 (bags) 的概念。尽管 MIL 在异常检测中利用不足,但它为现实世界数据集上的异常检测提供了一种引人注目的表述形式,这也是本文的主要贡献。本文提出了一种基于 MIL 的表述以及该框架基于关键组件不同设计决策的多种算法实例化。我们在捕获不同模态下不同物理过程的四个数据集上评估所得算法。实验评估得出了若干观察结果。基于 MIL 的表述在简单至中等难度数据集上表现不劣于单示例学习,在更具挑战性的数据集上优于单示例学习。总体而言,结果表明该框架在不同现实应用域产生的多样化数据集上具有良好的泛化能力。

关键词

引用

@article{arxiv.2210.01707,
  title  = {Multiple Instance Learning for Detecting Anomalies over Sequential Real-World Datasets},
  author = {Parastoo Kamranfar and David Lattanzi and Amarda Shehu and Daniel Barbará},
  journal= {arXiv preprint arXiv:2210.01707},
  year   = {2022}
}

备注

9 pages,5 figures, Anomaly and Novelty Detection, Explanation and Accommodation (ANDEA 2022)