中文

OMASGAN:用于边界样本生成的分布外最小异常分数 GAN

机器学习 2022-02-03 v2 机器学习

摘要

以无监督方式训练的 generative 模型可能对分布外(Out-of-Distribution, OoD)样本赋予高似然和低重建损失。这会增加第二类错误并导致异常漏检,总体上降低异常检测(Anomaly Detection, AD)性能。此外,由于异常稀少,AD 模型表现不佳。为应对这些局限,我们提出 OoD 最小异常分数 GAN(OMASGAN)。OMASGAN 以负数据增强的方式,在估计的分布边界上生成异常样本。这些样本随后被用于精炼 AD 模型,从而更准确地估计底层数据分布,包括具有不相连模式的多模态支撑。OMASGAN 通过将分布在边界上生成的异常最小异常分数 OoD 样本以自监督学习的方式纳入,进行再训练。在推理阶段,对于 AD,我们设计了一个判别器,该判别器以生成的(负或正)或真实的(仅正)负样本和正样本进行训练。OMASGAN 仅使用正常类数据在分布边界上生成强对抗性 OoD 样本,解决了异常稀少的问题,并有效应对模式崩溃。我们模型的一个关键特征是其变分表示中使用任意 f-散度分布度量,且不需要可逆性。OMASGAN 不使用特征工程,也不对数据分布作任何假设。使用留一法在图像数据上对 OMASGAN 的评估表明,在 MNIST 和 CIFAR-10 数据集上,其 AUROC 平均分别比其他基准和前沿 AD 模型至少提高 0.24 和 0.07 个点。

关键词

引用

@article{arxiv.2110.15273,
  title  = {OMASGAN: Out-of-Distribution Minimum Anomaly Score GAN for Sample Generation on the Boundary},
  author = {Nikolaos Dionelis and Mehrdad Yaghoobi and Sotirios A. Tsaftaris},
  journal= {arXiv preprint arXiv:2110.15273},
  year   = {2022}
}

备注

Research work paper, 9 pages, 10 figures, Appendix