中文

利用大规模健康保险理赔数据预测极高费用索赔者:一种机器学习方法

机器学习 2020-01-01 v1 机器学习

摘要

由于医疗成本不断攀升,准确预测哪些患者将产生高额费用,对医疗支付方和提供方而言是一项重要任务。高费用索赔者(HiCCs)是指年度费用超过 \250,000的患者,他们仅占参保人口的0.16 的患者,他们仅占参保人口的 0.16%,但目前占全部医疗费用的 9%。在本研究中,我们旨在开发一种高性能算法来预测 HiCCs,以支撑一种新型照护管理系统。利用来自 4800 万人的健康保险理赔数据并结合人口普查数据,我们应用机器学习训练二分类模型以计算个人的 HiCC 风险。为训练模型,我们构建了一个平台,起初涵盖所有临床与人口统计学维度的 6006 个变量,并构建了百余个候选模型。最佳模型在受试者工作特征曲线下的面积达到 91.2%。该模型超越了已发表的最高性能(84%),且对于无高费用状态既往史的患者(89%)、参保不足一整年的患者(87%)或缺少药房理赔数据的患者(88%)仍保持高性能。其在精确率-召回率曲线下的面积为 23.1%,在 0.99 阈值下精确率为 74%。一项纳入 500 名 HiCC 风险最高者的照护管理项目预计可治疗 199 名真实 HiCCs,并每年产生 $7.3百万的净节省。我们的结果表明,仅使用理赔数据与公开可用数据即可构建高性能预测模型,即便针对超过 百万的净节省。我们的结果表明,仅使用理赔数据与公开可用数据即可构建高性能预测模型,即便针对超过 $250,000$ 的罕见高费用索赔者也是如此。我们的模型展示了机器学习与人工智能在照护管理中的变革性力量,将使医疗支付方与提供方得以引入下一代照护管理项目。

关键词

引用

@article{arxiv.1912.13032,
  title  = {Using massive health insurance claims data to predict very high-cost claimants: a machine learning approach},
  author = {José M. Maisog and Wenhong Li and Yanchun Xu and Brian Hurley and Hetal Shah and Ryan Lemberg and Tina Borden and Stephen Bandeian and Melissa Schline and Roxanna Cross and Alan Spiro and Russ Michael and Alexander Gutfraind},
  journal= {arXiv preprint arXiv:1912.13032},
  year   = {2020}
}

备注

34 pages, 2 figures, In review in PLoS ONE