中文

基于频率与损失数据的保险定价神经网络:从数据预处理到技术费率表的基准研究

机器学习 2025-11-25 v4 风险管理

摘要

保险公司通常采用广义线性模型对索赔频率和损失数据进行建模。由于机器学习技术在其他领域的成功,其正日益受到精算工具箱的青睐。本文通过深度学习结构,对基于机器学习的频率-损失保险定价文献作出贡献。我们针对具有频率与损失目标以及多种输入特征类型的四个保险数据集,提出了一项基准研究。我们详细比较了以下模型的性能:基于分箱输入数据的广义线性模型、梯度提升树模型、前馈神经网络(FFNN)以及组合精算神经网络(CANN)。CANN分别将用GLM和GBM建立的基线预测与神经网络修正相结合。我们解释了数据预处理步骤,特别关注表格保险数据集中典型存在的多种输入特征类型,例如邮政编码、数值与分类协变量。自编码器用于将分类变量嵌入神经网络,我们探索了其在频率-损失设定中的潜在优势。模型性能评估不仅基于样本外偏差,还使用了统计与校准性能标准以及管理工具,以获得更细致的洞察。最后,我们为神经网络的频率与损失模型构建了全局代理模型。这些代理模型能够将FFNN或CANN所捕获的核心洞察转化为GLM。由此得到的技术费率表可轻松在实际中部署。

关键词

引用

@article{arxiv.2310.12671,
  title  = {Neural networks for insurance pricing with frequency and severity data: a benchmark study from data preprocessing to technical tariff},
  author = {Freek Holvoet and Katrien Antonio and Roel Henckaerts},
  journal= {arXiv preprint arXiv:2310.12671},
  year   = {2025}
}