中文

在延迟标签环境下评估实例增量与批量学习的有效性:面向欺诈检测的表格数据流实证研究

机器学习 2024-09-17 v1 计算工程、金融与科学 神经与进化计算

摘要

现实世界中的表格学习生产场景通常涉及不断演化的数据流,数据持续到达且其分布可能随时间变化。在这种设置下,文献中关于监督学习的大多数研究倾向于使用实例增量算法,因为它们能够适应数据分布的变化。选择这些算法的另一个重要原因是能够避免像批量增量设置中通常那样将观测数据存储在内存中。然而,实例增量算法的设计通常假设标签可立即获取,这是一种乐观的假设。在许多现实场景中,如欺诈检测或信用评分,标签可能会延迟。因此,批量增量算法被广泛应用于许多现实任务中。这提出了一个重要问题:“在延迟设置中,就预测性能和计算效率而言,实例增量学习是最佳选择吗?”遗憾的是,由于包含延迟信息的真实数据集稀缺,这个问题尚未得到深入研究。在本研究中,我们使用真实的欺诈检测问题和常用的生成数据集,对这一问题进行了全面的实证评估与分析。我们的研究结果表明,一方面考虑诸如Adaptive Random Forest (ARF) 等最先进模型,另一方面考虑诸如XGBoost等批量学习模型,实例增量学习并非更优的选择。此外,当考虑学习系统的可解释性时,批量增量解决方案往往更受青睐。代码:\url{https://github.com/anselmeamekoe/DelayedLabelStream}

关键词

引用

@article{arxiv.2409.10111,
  title  = {Evaluating the Efficacy of Instance Incremental vs. Batch Learning in Delayed Label Environments: An Empirical Study on Tabular Data Streaming for Fraud Detection},
  author = {Kodjo Mawuena Amekoe and Mustapha Lebbah and Gregoire Jaffre and Hanene Azzag and Zaineb Chelly Dagdia},
  journal= {arXiv preprint arXiv:2409.10111},
  year   = {2024}
}

备注

20 pages