基于医疗理赔数据使用 AutoML 框架进行疾病预测的基准评测
机器学习
2021-07-23 v1
摘要
我们确定并比较了 AutoML 工具在大规模、高度不平衡医疗数据集上的性能。我们使用 2019 年之前的四个不同时间窗口中的历史行政理赔数据(包括人口统计信息和疾病代码标记)生成了一个大规模数据集。然后我们在该数据集上训练了三种 AutoML 工具,以预测 2019 年的六种不同疾病结果,并在多项指标上评估模型性能。AutoML 工具较基线随机森林模型有所提升,但彼此之间无显著差异。所有模型的精确率-召回率曲线下面积均较低,且无法在保持高真负率的同时预测出真阳性。模型性能与患病率无直接关系。我们提供了一个具体用例来说明如何选择能给出真阳性率与假阳性率之间最佳平衡的阈值,因为这是医疗应用中的重要考量。医疗数据集给 AutoML 工具带来了若干挑战,包括大样本量、高度不平衡以及可用特征类型的限制。提升可扩展性、结合不平衡学习重采样与集成方法,以及精选特征选择,是取得更好性能的可能下一步。在所探索的三种工具中,没有任何一种 AutoML 工具在预测性能上持续优于其余工具。本研究中模型的表现表明,在处理医疗理赔数据方面仍有改进空间。最后,最优预测阈值的选择应由具体实际应用来指导。
引用
@article{arxiv.2107.10495,
title = {Benchmarking AutoML Frameworks for Disease Prediction Using Medical Claims},
author = {Roland Albert A. Romero and Mariefel Nicole Y. Deypalan and Suchit Mehrotra and John Titus Jungao and Natalie E. Sheils and Elisabetta Manduchi and Jason H. Moore},
journal= {arXiv preprint arXiv:2107.10495},
year = {2021}
}
备注
22 pages, 8 figures, 7 tables