通过数据增强提升图异常检测模型的泛化能力
机器学习
2023-06-21 v1 人工智能
摘要
图异常检测(GAD)是一项关键任务,因为即便少数异常也会对良性用户构成巨大威胁。近期的半监督 GAD 方法能有效利用可用标签作为先验知识,取得了优于无监督方法的性能。在实践中,人们通常需要在新的(子)图上识别异常以保障其业务安全,但可能缺乏标签来训练有效的检测模型。一个自然的想法是将训练好的 GAD 模型直接用于新(子)图进行测试。然而,我们发现现有的半监督 GAD 方法存在泛化性差的问题,即训练良好的模型在同一图中未见过区域(即训练时不可访问)上表现不佳。这可能引发严重麻烦。本文基于该现象提出一个通用且新颖的广义图异常检测研究问题,旨在有效识别训练域图和未见测试图上的异常以消除潜在危险。然而,这是一项具有挑战性的任务,因为仅有有限标签可用,且训练与测试数据的正常背景可能不同。为此,我们提出一种名为 AugAN(Augmentation for Anomaly and Normal distributions,异常与正常分布增强)的数据增强方法,以丰富训练数据并提升 GAD 模型的泛化能力。实验验证了该方法在改善模型泛化性方面的有效性。
引用
@article{arxiv.2306.10534,
title = {Improving Generalizability of Graph Anomaly Detection Models via Data Augmentation},
author = {Shuang Zhou and Xiao Huang and Ninghao Liu and Huachi Zhou and Fu-Lai Chung and Long-Kai Huang},
journal= {arXiv preprint arXiv:2306.10534},
year = {2023}
}
备注
Accepted to IEEE Transactions on Knowledge and Data Engineering (TKDE). arXiv admin note: substantial text overlap with arXiv:2209.10168