关于分层类别型风险因子的聚类
统计方法学
2024-06-13 v3 应用统计
摘要
处理具有大量类别的标称协变量对统计与机器学习技术均具挑战性。当该标称变量具有层次结构时,问题进一步加剧。我们通常依赖随机效应方法(Campo 与 Antonio,2023)等将此类协变量纳入预测模型。然而在某些情况下,即便随机效应方法也会遭遇估计问题。我们提出数据驱动的分割分层风险因子自适应自顶向下(PHiRAT)算法,通过在层次各层将相似类别分组,将分层结构风险因子精简至其本质。我们自顶向下工作,并设计若干特征以刻画特定层上各类别的轮廓。在工伤赔偿案例研究中,我们通过观测损失率与索赔频率刻画行业的风险轮廓。此外,我们利用嵌入(Mikolov 等,2013;Cer 等,2018)编码被保险公司的经济活动文本描述。这些特征随后作为聚类算法输入以分组相似类别。我们的方法大幅减少类别数量,并产生可泛化至样本外数据的分组。而且,我们获得高风险与低风险公司间更好的区分。
引用
@article{arxiv.2304.09046,
title = {On clustering levels of a hierarchical categorical risk factor},
author = {Bavo D. C. Campo and Katrien Antonio},
journal= {arXiv preprint arXiv:2304.09046},
year = {2024}
}