数据泄露与欺骗性性能:信用卡欺诈检测方法的批判性审视
机器学习
2025-11-11 v3 人工智能
计算机与社会
摘要
本研究批判性地审视了信用卡欺诈检测研究中的方法学严谨性,揭示了基本的评估缺陷如何掩盖算法的复杂性。通过故意使用不当的评估协议进行实验,我们证明了当违反基本的方法学原则时,即使是简单的模型也能取得看似惊人的结果。我们的分析指出了当前方法中存在的四个关键问题:(1)不当预处理顺序导致的普遍数据泄露;(2)方法学报告中的故意模糊;(3)对交易数据的时间验证不足;(4)通过牺牲精确率来优化召回率从而进行指标操纵。我们展示了一个案例研究,说明存在数据泄露的最小神经网络架构如何超越文献中报道的许多复杂方法,尽管存在根本性的评估缺陷,仍实现了 99.9\% 的召回率。这些发现强调,在欺诈检测研究中,正确的评估方法比模型复杂性更为重要。本研究作为一个警示案例,说明方法学严谨性必须先于架构复杂性,对改进整个机器学习应用领域的研究实践具有启示意义。
引用
@article{arxiv.2506.02703,
title = {Data Leakage and Deceptive Performance: A Critical Examination of Credit Card Fraud Detection Methodologies},
author = {Khizar Hayat and Baptiste Magnier},
journal= {arXiv preprint arXiv:2506.02703},
year = {2025}
}