重思弱监督异常检测:综合基准
机器学习
2026-05-27 v2 人工智能
摘要
弱监督异常检测(WSAD)在三个主要方向上取得了发展:不完整、不精确和不准确的监督。然而,这些方向仍然是孤立的,缺乏统一的框架来评估它们是否解决独特挑战或共享基本机制。本文引入 WSADBench,首个统一跨不同弱监督情景评估的基准,基准评估从专门的 WSAD 方法到先进的表格基础模型等多样化方法。WSADBench 建立了标准化协议,以系统性地变更标签数量、粒度和质量,对 36 种算法进行 4 种模态的评估,揭示了各种方法的性能边界。基于超过 70 万次实验,WSADBench 揭示了四项关键见解:(i) 这些弱监督情景之间存在强烈的内在相关性,挑战了当前研究方向的孤立性。(ii) 专门的 WSAD 算法仅在极端标签稀缺情境中表现突出,但随着监督增加或在 OOD 情景下,被表格基础模型和通用分类方法快速取代。(iii) 无标签数据在不同情境下的实用性不一致,与标签细化相比仅带来有限的收益。(iv) 模型对不同类型标签噪声表现出不对称的敏感性。我们将 WSADBench 作为开源基准发布,包含代码和数据集,以促进未来 WSAD 研究:https://github.com/SUFE-AILAB/WSADBench。
引用
@article{arxiv.2605.26068,
title = {Rethinking Weak Supervision in Anomaly Detection: A Comprehensive Benchmark},
author = {Xu Yao and Siyuan Zhou and Zhenbo Wu and Chaochuan Hou and Shuang Liang and Shiping Wang and Hailiang Huang and Songqiao Han and Minqi Jiang},
journal= {arXiv preprint arXiv:2605.26068},
year = {2026}
}
备注
Accepted at KDD 2026 Datasets and Benchmarks Track