中文

评估XGBoost在平衡与不平衡数据上的表现:以欺诈检测为例

机器学习 2023-03-28 v1 人工智能

摘要

本文评估了XGBoost在不同数据集规模与类别分布(从完全平衡到高度不平衡)下的性能。选用XGBoost进行评估,是因为其在多项基准测试中凭借检测性能与速度脱颖而出。在引入欺诈检测问题后,本文回顾了检测系统或二分类器的评估指标,并通过示例说明不同指标在平衡与不平衡数据集上的工作方式。随后,考察了XGBoost的原理。提出了一种数据准备流程,并将原始XGBoost与随机搜索调优的XGBoost进行比较。随机搜索微调对10万样本的大规模数据集带来一致改进,对1万和1千样本的中小规模数据集则不然。此外,正如预期,XGBoost识别性能随数据增多而提升,并随数据集更不平衡而检测性能下降。在阳性样本占比50%、45%、25%和5%的分布上的测试表明,检测性能的最大降幅出现在仅含5%阳性样本的分布上。对训练集采样以平衡并未带来一致改进。因此,未来工作将包括系统研究应对数据不平衡的不同技术,并评估图、自动编码器与生成对抗方法等其他途径,以应对标签匮乏问题。

关键词

引用

@article{arxiv.2303.15218,
  title  = {Evaluating XGBoost for Balanced and Imbalanced Data: Application to Fraud Detection},
  author = {Gissel Velarde and Anindya Sudhir and Sanjay Deshmane and Anuj Deshmunkh and Khushboo Sharma and Vaibhav Joshi},
  journal= {arXiv preprint arXiv:2303.15218},
  year   = {2023}
}

备注

17 pages, 8 figures, 9 tables, Presented at NVIDIA GTC, The Conference for the Era of AI and the Metaverse, March 23, 2023. [S51129]