面向反洗钱模型的真实合成金融交易数据
人工智能
2024-01-26 v3 机器学习
计算金融
摘要
随着金融的广泛数字化和加密货币的日益普及,网络犯罪分子设计的欺诈手段愈发复杂。洗钱——转移非法资金以掩饰其来源——可跨越银行与国界,产生复杂的交易模式。联合国估计全球每年有 2-5% 的 GDP 即 0.8-2.0 万亿美元被洗钱。遗憾的是,用于训练检测洗钱机器学习模型的真实数据通常不可得,且先前的合成数据生成器存在显著缺陷。该领域需要一种真实、标准化、公开可用的基准以比较模型并推动进展。为此,本文贡献了一个合成金融交易数据集生成器及一组合成生成的 AML(反洗钱)数据集。我们将该基于智能体的生成器校准至尽可能匹配真实交易,并公开了这些数据集。我们详细描述了生成器,并展示所生成的数据集如何帮助比较不同机器学习模型的 AML 能力。关键在于,在这些比较中使用合成数据甚至优于真实数据:其真值标签是完整的,而真实数据中许多洗钱交易从未被检测到。
引用
@article{arxiv.2306.16424,
title = {Realistic Synthetic Financial Transactions for Anti-Money Laundering Models},
author = {Erik Altman and Jovan Blanuša and Luc von Niederhäusern and Béni Egressy and Andreea Anghel and Kubilay Atasu},
journal= {arXiv preprint arXiv:2306.16424},
year = {2024}
}