保险数据集的生成式合成
应用统计
2020-08-07 v2 机器学习
风险管理
摘要
推进精算研究并为保险分析开发开源资产的一大障碍是缺乏现实的公开可用数据集。在本工作中,我们开发了一种利用 CTGAN(一种近期提出的用于生成表格数据的神经网络架构)合成保险数据集的工作流。将所提工作流应用于一般保险定价与寿险冲击退保建模领域的公开数据,我们从几个角度评估了合成数据集:机器学习效能、变量分布以及模型参数的稳定性。该工作流通过 R 接口实现,以促进研究人员与数据拥有者的采用。
引用
@article{arxiv.1912.02423,
title = {Generative Synthesis of Insurance Datasets},
author = {Kevin Kuo},
journal= {arXiv preprint arXiv:1912.02423},
year = {2020}
}