欺诈数据集基准及其应用
机器学习
2023-09-26 v3 密码学与安全
机器学习
摘要
标准化数据集与基准已激发了计算机视觉、自然语言处理、多模态与表格场景中的创新。我们注意到,与其他研究充分的领域相比,欺诈检测具有独特挑战:高度类别不平衡、特征类型多样、欺诈模式频繁变化,以及问题的对抗性本质。由于这些原因,在其他研究领域数据集上评估的建模方法可能对欺诈检测效果不佳。本文中,我们引入欺诈数据集基准(FDB),一个面向欺诈检测的公开可用数据集汇编。FDB 包含多种欺诈相关任务,从识别欺诈性卡不在场交易、检测机器人攻击、分类恶意 URL、估计贷款违约风险到内容审核。FDB 的基于 Python 的库提供了一致的数据加载 API 与标准化训练/测试划分。我们展示了 FDB 在欺诈检测中广受关注的若干应用,包括特征工程、监督学习算法比较、标签噪声去除、类别不平衡处理与半监督学习。我们希望 FDB 为欺诈检测领域的研究人员与实践者提供一个通用平台,以开发面向各类欺诈用例的鲁棒且定制化的机器学习技术。
引用
@article{arxiv.2208.14417,
title = {Fraud Dataset Benchmark and Applications},
author = {Prince Grover and Julia Xu and Justin Tittelfitz and Anqi Cheng and Zheng Li and Jakub Zablocki and Jianbo Liu and Hao Zhou},
journal= {arXiv preprint arXiv:2208.14417},
year = {2023}
}