中文

通过层次化多源数据蒸馏实现金融领域安全且可解释的欺诈检测

机器学习 2025-12-29 v1 人工智能

摘要

我们提出了一个可解释的、保护隐私的数据蒸馏框架,用于协作式金融欺诈检测。训练好的随机森林被转换为透明的、轴对齐的规则区域(叶节点超矩形),并通过在每个区域内均匀采样生成合成交易。这产生了一个紧凑的、可审计的替代数据集,该数据集保留了局部特征交互,而不暴露敏感的原始记录。规则区域还支持可解释性:聚合的规则统计量(例如,支持度和提升度)描述全局模式,而将每个案例分配到其生成区域则给出了简洁的、人类可读的理由以及基于树投票分歧的校准不确定性。在 IEEE-CIS 欺诈数据集(跨越三个类机构集群的 59 万笔交易)上,蒸馏数据集将数据量减少了 85% 到 93%(通常低于原始数据的 15%),同时保持了具有竞争力的精确率和 micro-F1,仅有适度的 AUC 下降。跨机构共享和增强合成数据提高了跨集群的精确率、召回率和 AUC。真实与合成数据的结构保持高度相似(通过最近邻余弦分析超过 93%)。成员推理攻击在区分训练记录与保留记录时表现处于随机水平(约 0.50),表明记忆风险较低。使用分歧分数移除高不确定性的合成点进一步提升了 AUC(高达 0.687)并改善了校准。敏感性测试表明对蒸馏比率的依赖较弱(从 6% 到 60%,AUC 约为 0.641 到 0.645)。总体而言,树区域蒸馏实现了可信、可部署的欺诈分析,具有可解释的全局规则、带有量化不确定性的逐案理由,以及适用于多机构环境和监管审计的强隐私保护特性。

关键词

引用

@article{arxiv.2512.21866,
  title  = {Secure and Explainable Fraud Detection in Finance via Hierarchical Multi-source Dataset Distillation},
  author = {Yiming Qian and Thorsten Neumann and Xueyining Huang and David Hardoon and Fei Gao and Yong Liu and Siow Mong Rick Goh},
  journal= {arXiv preprint arXiv:2512.21866},
  year   = {2025}
}