中文

采样技术与数据泄露对XGBoost在信用卡欺诈检测中性能的影响

机器学习 2024-12-11 v1

摘要

信用卡欺诈检测仍是金融安全领域的关键挑战,XGBoost(eXtreme gradient boosting)等机器学习模型已成为识别欺诈交易的强大工具。然而,信用卡交易数据集中固有的类别不平衡对模型性能构成了重大挑战。尽管采样技术常被用于解决这种不平衡,但其实施有时发生在训练-测试划分之前,可能引入数据泄露。本研究对XGBoost在信用卡欺诈检测中三种场景下的性能进行了比较分析:第一,不使用任何不平衡处理技术;第二,仅在训练-测试划分后的训练集上应用采样技术;第三,在训练-测试划分前应用采样技术。我们使用了Kaggle上的一个包含284,807笔信用卡交易的数据集,其中欺诈案例占0.172%,以评估这些方法。我们的发现表明,虽然采样策略能够提升模型性能,但结果可靠性受到其应用时机的极大影响。由于采样阶段经常出现的数据泄露问题,在训练-测试划分前进行采样的数据上训练的XGBoost模型可能表现出人为膨胀的性能指标。令人惊讶的是,仅在训练集上应用采样技术的模型取得了显著低于划分前采样模型的结果,同时保持了评估过程的完整性。

关键词

引用

@article{arxiv.2412.07437,
  title  = {Impact of Sampling Techniques and Data Leakage on XGBoost Performance in Credit Card Fraud Detection},
  author = {Siyaxolisa Kabane},
  journal= {arXiv preprint arXiv:2412.07437},
  year   = {2024}
}

备注

19 pages, 4 figures