欺诈不仅是稀有:基于因果原型注意力的真实合成过采样方法
机器学习
2025-07-22 v1 人工智能
摘要
检测信用卡欺诈交易仍是一大挑战,due to real-world data中的极端类别不平衡以及细微的模式将欺诈与合法活动区分开来。现有研究常尝试通过生成对抗网络(GAN)、变分自编码器(VAE)或混合生成模型为少数类生成合成样本。然而,这些技术特别是仅应用于少数类数据时,往往导致分类器过于自信,且潜在簇分离性差,最终限制了实际检测性能。本研究提出Causal Prototype Attention Classifier(CPAC),一种可解释的架构,通过基于原型的注意力机制促进class-aware聚类和改进潜在空间结构,辅以VAE-GAN中的encoder,实现更好的簇分离,超越事后样本增强。我们将CPAC增强模型与传统过采样器(如SMOTE)以及最新生成模型进行比较,分别在有无CPAC基于latent分类器的情况下进行评估。结果表明,基于CPAC的classifier-guided latent shaping在性能上显著优于传统方法,实现F1分数93.14%,召回率90.18%,并改善了潜在簇的分离性。进一步的消融研究和可视化分析提供了对classifier-driven representation learning在欺诈检测中优势与局限的深入见解。本工作的代码将在最终提交时发布。
引用
@article{arxiv.2507.14706,
title = {Fraud is Not Just Rarity: A Causal Prototype Attention Approach to Realistic Synthetic Oversampling},
author = {Claudio Giusti and Luca Guarnera and Mirko Casu and Sebastiano Battiato},
journal= {arXiv preprint arXiv:2507.14706},
year = {2025}
}
备注
23 pages, 14 figures