中文

FiFAR:面向学习延迟的欺诈检测数据集

机器学习 2023-12-21 v1 人工智能

摘要

公开数据集的局限性严重阻碍了学习延迟(L2D)算法的开发与基准测试,该算法旨在混合决策系统中实现人类与AI能力的最优结合。在此类系统中,人类的可用性及特定领域的关注点带来了诸多困难,而获取用于训练和评估的人类预测则成本高昂。金融欺诈检测是一个高风险场景,算法与人类专家通常协同工作;然而,目前尚无关于人机协作这一重要应用的公开 L2D 数据集。为了填补 L2D 研究中的这一空白,我们引入了金融欺诈警报审查数据集(FiFAR),这是一个合成的银行账户欺诈检测数据集,包含由 50 名高度复杂且多样的合成欺诈分析师组成的团队的预测,这些分析师具有不同的偏差和特征依赖性。我们还提供了人类工作能力约束的现实定义,这是 L2D 系统中常被忽视的一个方面,允许在真实世界条件下对分配系统进行广泛测试。我们利用我们的数据集开发了一种感知容量的 L2D 方法以及现实数据可用性条件下的拒绝学习方法,并在 300 种不同的测试场景中对这些基线进行了基准测试。我们相信,该数据集将成为促进对 L2D 方法进行系统、严格、可复现和透明评估与比较的关键工具,从而促进决策系统中更具协同性的人机协作的发展。公开数据集和详细的合成专家信息可在以下网址获取:https://github.com/feedzai/fifar-dataset

关键词

引用

@article{arxiv.2312.13218,
  title  = {FiFAR: A Fraud Detection Dataset for Learning to Defer},
  author = {Jean V. Alves and Diogo Leitão and Sérgio Jesus and Marco O. P. Sampaio and Pedro Saleiro and Mário A. T. Figueiredo and Pedro Bizarro},
  journal= {arXiv preprint arXiv:2312.13218},
  year   = {2023}
}

备注

The public dataset and detailed synthetic expert information are available at: https://github.com/feedzai/fifar-dataset