一种用于模拟保险欺诈网络数据的引擎
机器学习
2024-10-08 v2 应用统计
统计计算
摘要
传统上,保险欺诈索赔的检测依赖于业务规则与专家判断,这使得该过程耗时且昂贵(Óskarsdóttir et al., 2022)。因此,研究者一直在探索开发高效且准确的分析策略以标记可疑索赔。利用从索赔相关方社交网络中提取的特征来训练学习方法是一种尤其有前景的策略(例如见 Van Vlasselaer et al. (2016); Tumminello et al. (2023))。然而,在开发欺诈检测模型时,我们面临若干挑战。例如,欺诈的罕见性造成了严重的类别不平衡,使高性能分析分类模型的开发复杂化。此外,仅有少量索赔被调查并获得标签,导致大量未标记数据。另一挑战是缺乏公开可用数据。这不仅阻碍新方法的开发,也妨碍现有技术的验证。为此,我们设计了一台仿真机器,旨在生成具有网络结构且协变量类似于 Óskarsdóttir et al. (2022) 中分析的真实保险欺诈数据集的合成数据。进一步,用户可控制若干数据生成机制。我们可以指定投保人与相关方的总数、所需的类别不平衡程度以及欺诈生成模型中特征的(效应量)。如此,该仿真引擎使研究者和从业者能够在多种不同设定下考察若干方法学挑战,并测试其保险欺诈检测模型的(开发策略)。此外,可生成大型合成数据集以评估(先进)机器学习技术的预测性能。
引用
@article{arxiv.2308.11659,
title = {An engine to simulate insurance fraud network data},
author = {Bavo D. C. Campo and Katrien Antonio},
journal= {arXiv preprint arXiv:2308.11659},
year = {2024}
}