中文

通过数据增强提升图异常检测模型的泛化能力

机器学习 2023-06-21 v1 人工智能

摘要

图异常检测(GAD)是一项关键任务,因为即便少数异常也会对良性用户构成巨大威胁。近期的半监督 GAD 方法能有效利用可用标签作为先验知识,取得了优于无监督方法的性能。在实践中,人们通常需要在新的(子)图上识别异常以保障其业务安全,但可能缺乏标签来训练有效的检测模型。一个自然的想法是将训练好的 GAD 模型直接用于新(子)图进行测试。然而,我们发现现有的半监督 GAD 方法存在泛化性差的问题,即训练良好的模型在同一图中未见过区域(即训练时不可访问)上表现不佳。这可能引发严重麻烦。本文基于该现象提出一个通用且新颖的广义图异常检测研究问题,旨在有效识别训练域图和未见测试图上的异常以消除潜在危险。然而,这是一项具有挑战性的任务,因为仅有有限标签可用,且训练与测试数据的正常背景可能不同。为此,我们提出一种名为 AugAN(Augmentation for Anomaly and Normal distributions,异常与正常分布增强)的数据增强方法,以丰富训练数据并提升 GAD 模型的泛化能力。实验验证了该方法在改善模型泛化性方面的有效性。

关键词

引用

@article{arxiv.2306.10534,
  title  = {Improving Generalizability of Graph Anomaly Detection Models via Data Augmentation},
  author = {Shuang Zhou and Xiao Huang and Ninghao Liu and Huachi Zhou and Fu-Lai Chung and Long-Kai Huang},
  journal= {arXiv preprint arXiv:2306.10534},
  year   = {2023}
}

备注

Accepted to IEEE Transactions on Knowledge and Data Engineering (TKDE). arXiv admin note: substantial text overlap with arXiv:2209.10168