中文

信用卡欺诈检测的比较研究:监督式与无监督式

机器学习 2019-04-25 v1

摘要

信用卡已成为线上线下购买的流行支付方式,导致每日欺诈交易不断增加。因此,高效的欺诈检测方法对于维持支付系统的可靠性至关重要。本研究使用多种监督式与无监督式方法对信用卡欺诈检测进行比较研究。具体地,本文探讨了 6 种监督式分类模型,即逻辑回归(LR)、K近邻(KNN)、支持向量机(SVM)、决策树(DT)、随机森林(RF)、极端梯度提升(XGB),以及 4 种无监督式异常检测模型,即单类支持向量机(OCSVM)、自编码器(AE)、受限玻尔兹曼机(RBM)和生成对抗网络(GAN)。我们在来自 Kaggle 网站的公开信用卡交易数据集上训练所有这些模型,该数据集包含 284,807 笔交易中的 492 笔欺诈。交易标签仅用于监督式学习模型。各模型性能通过 5 折交叉验证按受试者工作特征曲线下面积(AUROC)评估。在监督式方法中,XGB 与 RF 取得最佳性能,AUROC 分别为 0.989 与 0.988。而在无监督式方法中,RBM 以 AUROC = 0.961 取得最佳性能,其次为 GAN(AUROC = 0.954)。实验结果表明,本研究中监督式模型表现略优于无监督式模型。无论如何,由于现实应用中标注不足与数据不平衡问题,无监督式方法在信用卡欺诈交易检测中仍具前景。

关键词

引用

@article{arxiv.1904.10604,
  title  = {A Comparison Study of Credit Card Fraud Detection: Supervised versus Unsupervised},
  author = {Xuetong Niu and Li Wang and Xulei Yang},
  journal= {arXiv preprint arXiv:1904.10604},
  year   = {2019}
}