robROSE:一种处理欺诈检测中不平衡数据的鲁棒方法
机器学习
2020-03-27 v1 密码学与安全
应用统计
机器学习
摘要
在试图检测欺诈时,一个主要挑战是欺诈活动构成了数据集中占比极小的一个少数类。在大多数数据集中,欺诈通常出现在不到 0.5% 的案例中。在此类高度不平衡的数据集中检测欺诈通常会导致偏向多数类的预测,致使欺诈未被发现。我们讨论了一些流行的过采样技术,这些技术通过创建模拟少数类的合成样本来解决数据不平衡问题。分析真实数据时的一个常见问题是异常值或离群点的存在。当数据中存在此类非典型观测时,大多数过采样技术易于生成扭曲检测算法并破坏最终分析的合成样本。异常检测的一个有用工具是鲁棒统计,其旨在通过先拟合大部分数据然后标记偏离该拟合的观测来发现离群点。在本文中,我们提出 ROSE 的鲁棒版本,称为 robROSE,它结合了几种有前景的方法,以同时应对不平衡数据和离群点存在的问题。所提出的方法能够在忽略异常的同时增强欺诈案例的显现。我们新采样技术的良好性能在模拟和真实数据集上得到了说明,并且表明 robROSE 能够更好地理解数据结构。robROSE 算法的源代码已免费公开。
引用
@article{arxiv.2003.11915,
title = {robROSE: A robust approach for dealing with imbalanced data in fraud detection},
author = {Bart Baesens and Sebastiaan Höppner and Irene Ortner and Tim Verdonck},
journal= {arXiv preprint arXiv:2003.11915},
year = {2020}
}