RoSAS:具有抗污染连续监督的深度半监督异常检测
机器学习
2023-07-26 v1 人工智能
摘要
半监督异常检测方法利用少量异常样本,相比无监督模型可大幅提升性能。然而,它们仍存在两个局限:1)当所有未标记数据都被用作正常样本进行模型训练时,未标记的异常(即异常污染)可能误导学习过程;2)仅利用了离散监督信息(如二值或序数数据标签),导致对本质上呈连续分布的异常分数的学习不够理想。因此,本文提出一种新颖的半监督异常检测方法,其设计了抗污染连续监督信号。具体而言,我们提出一种质量插值方法,扩散已标记异常的异常性,从而生成带有连续异常程度标签的新数据样本。同时,由正确标签数据组合生成的新数据样本可覆盖污染区域。我们加入一个基于特征学习的优化目标作为约束,以正则化网络并进一步增强对异常污染的鲁棒性。在11个真实数据集上的大量实验表明,我们的方法在AUC-PR上比最先进的对比方法显著高出20%–30%,并在不同异常污染水平和不同数量标记异常的设置下获得更鲁棒和更优的性能。源代码见 https://github.com/xuhongzuo/rosas/。
引用
@article{arxiv.2307.13239,
title = {RoSAS: Deep Semi-Supervised Anomaly Detection with Contamination-Resilient Continuous Supervision},
author = {Hongzuo Xu and Yijie Wang and Guansong Pang and Songlei Jian and Ning Liu and Yongjun Wang},
journal= {arXiv preprint arXiv:2307.13239},
year = {2023}
}
备注
Accepted by Information Processing and Management (IP&M)