中文

面向下游任务的生成模型选择:用于欺诈检测模型的合成数据训练

机器学习 2024-01-03 v1 人工智能

摘要

制定面向下游任务的生成模型选择程序是一个尚未解决且具有实际重要性的问题。现有研究集中于单一生成模型族的效用,对于合成数据从业者如何在给定特定机器学习模型类别和性能指标组合的情况下,为合成训练任务选择最佳的生成模型族,提供的见解有限。在本文中,我们针对训练欺诈检测模型的情况,探讨了面向下游任务的生成模型选择问题,并研究了在不同模型可解释性和模型性能约束组合下的最佳实践。我们的研究支持:在宽松的模型可解释性约束下,基于神经网络(NN)和基于贝叶斯网络(BN)的生成模型都能很好地完成合成训练任务;但在严格的模型可解释性约束下,基于BN的生成模型优于基于NN的生成模型。我们的结果为有兴趣将训练数据集从真实数据替换为合成数据的机器学习从业者提供了实践指导,并为更一般的面向下游任务的生成模型选择问题提供了启示。

关键词

引用

@article{arxiv.2401.00974,
  title  = {Downstream Task-Oriented Generative Model Selections on Synthetic Data Training for Fraud Detection Models},
  author = {Yinan Cheng and Chi-Hua Wang and Vamsi K. Potluru and Tucker Balch and Guang Cheng},
  journal= {arXiv preprint arXiv:2401.00974},
  year   = {2024}
}

备注

The following article has been accepted by ICAIF22, Synthetic Data for AI in Finance; see https://sites.google.com/view/icaif-synthetic-2022/program