基于 Huber 损失的超级学习器及其在医疗支出中的应用
机器学习
2022-05-17 v1 机器学习
摘要
医疗支出的复杂分布对通过单一模型进行统计建模提出了挑战。超级学习(super learning)是一种组合一系列候选模型的集成方法,是成本估计的有前景的替代方案,并已显示出优于单一模型的好处。然而,在存在极端值的情形下(例如医疗支出数据),标准的超级学习方法可能表现不佳。我们提出一种基于 Huber 损失的超级学习器,Huber 损失是一种“鲁棒”损失函数,它结合平方误差损失与绝对损失以削弱异常值的影响。我们推导出确立该方法有限样本和渐近性能界限的预言不等式。我们表明所提出的方法既可直接用于优化 Huber 风险,也可用于以优化均方误差为最终目标的有限样本情形。对于后一种情形,我们提供两种方法来对索引 Huber 损失的鲁棒化参数执行网格搜索。模拟和真实数据分析表明,使用我们提出的方法在成本预测和因果效应估计方面取得了可观的有限样本增益。
引用
@article{arxiv.2205.06870,
title = {A Huber loss-based super learner with applications to healthcare expenditures},
author = {Ziyue Wu and David Benkeser},
journal= {arXiv preprint arXiv:2205.06870},
year = {2022}
}