金融合成数据生成中的隐私风险与权衡测量
机器学习
2026-02-11 v1
摘要
我们探讨了合成数据生成方案在表格金融数据集上的隐私-效用权衡,金融数据特征在高监管风险和严重类别不平衡方面具有挑战性。我们考虑代表性的表格数据生成器,包括自动编码器、生成对抗网络、扩散模型和 copula 合成器。为了应对金融领域的挑战,我们提供了 GAN 和自动编码器合成器的新型隐私保护实现。我们评估了生成器是否以及如何在同时实现数据质量、下游效用和隐私方面表现良好,比较平衡与不平衡输入数据集。我们的结果为从 exhibit 严重类别不平衡和混合类型属性的数据集生成合成数据提供了独特挑战的见解。
引用
@article{arxiv.2602.09288,
title = {Measuring Privacy Risks and Tradeoffs in Financial Synthetic Data Generation},
author = {Michael Zuo and Inwon Kang and Stacy Patterson and Oshani Seneviratne},
journal= {arXiv preprint arXiv:2602.09288},
year = {2026}
}