驾驶员车联网数据的合成数据集生成
机器学习
2021-02-02 v1 机器学习
摘要
本文描述了在生成从类似真实保险数据集仿真的驾驶员车联网合成数据集时所采用的技术。生成的合成数据集包含100,000份保单,其中涵盖了驾驶员的理赔经历以及相关的经典风险变量和车联网相关变量的观测值。本工作旨在产生一种可用于推进基于用量计费保险风险建模的资源。它采用使用机器学习算法的三阶段流程。第一阶段是将索赔次数作为多重二分类,应用前馈神经网络模拟其值。第二阶段是将聚合索赔金额作为回归,使用包含索赔次数作为特征变量集的前馈神经网络模拟其值。在最后阶段,应用扩展的算法生成特征变量空间的合成组合。通过在分别对合成与真实数据集拟合泊松和伽马回归模型时进行比较来评估所得数据集。其他可视化和数据汇总显示两个数据集之间具有显著相似的统计特征。我们希望对获取车联网数据集以校准模型或学习算法感兴趣的研究人员会发现我们的工作有价值。
引用
@article{arxiv.2102.00252,
title = {Synthetic Dataset Generation of Driver Telematics},
author = {Banghee So and Jean-Philippe Boucher and Emiliano A. Valdez},
journal= {arXiv preprint arXiv:2102.00252},
year = {2021}
}
备注
24 pages, 11 figures, 6 tables