基于不平衡类别下优化机器学习工具的欺诈检测
机器学习
2022-09-07 v1
摘要
由于欺诈模式随时间变化且可用于学习此类复杂模式的欺诈样本有限,欺诈检测是一项艰巨任务。因此,借助智能化机器学习 (ML) 工具进行欺诈检测对于保障安全至关重要。欺诈检测是一项基本的 ML 分类任务;然而,相应 ML 工具的最佳性能依赖于使用最优超参数值。此外,不平衡类别下的分类极具挑战,因其导致少数类性能不佳,而多数 ML 分类技术忽视了这一点。因此,我们研究了四种适用于处理不平衡类别的先进 ML 技术,即逻辑回归、决策树、随机森林与极端梯度提升,以最大化精确率并同时减少假阳性。首先,这些分类器在两个原始基准不平衡欺诈检测数据集上训练,即钓鱼网站 URL 与欺诈信用卡交易。随后,通过实施 RandomUnderSampler、SMOTE 与 SMOTEENN 采样框架,为每个原始数据集生成三个合成平衡数据集。所有 16 项实验的最优超参数由 RandomzedSearchCV 方法揭示。使用两个基准性能指标,即受试者工作特征曲线下面积 (AUC ROC) 与精确率-召回率曲线下面积 (AUC PR),比较了 16 种方法在欺诈检测中的有效性。对于钓鱼网站 URL 与信用卡欺诈交易数据集,结果表明在原始数据上训练的极端梯度提升在不平衡数据中表现出可信性能,并在 AUC ROC 与 AUC PR 上均优于其他三种方法。
引用
@article{arxiv.2209.01642,
title = {Fraud Detection Using Optimized Machine Learning Tools Under Imbalance Classes},
author = {Mary Isangediok and Kelum Gajamannage},
journal= {arXiv preprint arXiv:2209.01642},
year = {2022}
}
备注
10 pages, 10 figures, submitted to IEEE BigData 2022 conference