使用生成对抗网络合成财产与意外险费率厘定数据集
机器学习
2020-08-17 v1 机器学习
摘要
由于保密问题,在精算科学或其他个人数据重要的领域中,获取或共享用于方法开发的有趣数据集可能较为困难。我们展示了如何设计三种不同类型的生成对抗网络(GANs),以从保密的原始数据集构建合成保险数据集。目标是获得不再包含敏感信息但仍具有与原始数据集相同结构并保留多元关系的合成数据。为充分建模保险数据的特定特征,我们使用适用于多类别数据的 GAN 架构:带梯度惩罚的 Wasserstein GAN(MC-WGAN-GP)、条件表格 GAN(CTGAN)以及混合数值与类别差分隐私 GAN(MNCDP-GAN)。为透明起见,使用公开数据集——法国机动车第三方责任数据——对这些方法进行说明。我们在多个方面比较这三种不同的 GAN:复现原始数据结构和预测模型的能力、隐私性以及易用性。我们发现 MC-WGAN-GP 合成的数据最佳,CTGAN 最易使用,而 MNCDP-GAN 保证差分隐私。
引用
@article{arxiv.2008.06110,
title = {Synthesizing Property & Casualty Ratemaking Datasets using Generative Adversarial Networks},
author = {Marie-Pier Cote and Brian Hartman and Olivier Mercier and Joshua Meyers and Jared Cummings and Elijah Harmon},
journal= {arXiv preprint arXiv:2008.06110},
year = {2020}
}