面向真正无监督图异常检测的自动化自监督学习
机器学习
2025-07-01 v2 人工智能
摘要
自监督学习(SSL)是一种利用数据自身生成的监督信号的新兴范式,许多近期研究都利用SSL进行图异常检测。然而,我们经验性地发现,三个重要因素会在不同数据集上显著影响检测性能:1)所采用的具体SSL策略;2)策略超参数的调优;3)在使用多个策略时,组合权重的分配。大多数基于SSL的图异常检测方法通过任意选择或选择性(即利用标签信息引导)来选择SSL策略、超参数设置和组合权重。虽然任意选择可能导致性能不佳,但在无监督设置中使用标签信息属于标签信息泄露,会严重高估方法的性能。泄露问题被批评为“数据挖掘十大错误之一”,然而近期许多关于SSL基于图异常检测的研究都使用标签信息来选择超参数。为缓解此问题,我们提出使用内部评估策略(具有理论分析)来选择无监督异常检测中SSL的超参数。我们在多个基准数据集上使用10个最新的SSL基于图异常检测算法进行大量实验,展示了超参数选择的先前问题以及我们所提出策略的有效性。
引用
@article{arxiv.2501.14694,
title = {Towards Automated Self-Supervised Learning for Truly Unsupervised Graph Anomaly Detection},
author = {Zhong Li and Yuhang Wang and Matthijs van Leeuwen},
journal= {arXiv preprint arXiv:2501.14694},
year = {2025}
}
备注
Manuscript accepted by Data Mining and Knowledge Discovery for publication (June 2025). This is the final revised version