中文

机器学习基于预测模型的类别不平衡校正危害:模拟研究

统计方法学 2024-05-01 v1

摘要

风险预测模型越来越多地用于医疗保健,以辅助临床决策。在大多数临床情境中,模型校准(即评估风险估计可靠性)至关重要。用于模型开发的数据在针对所建模结果的情况下(即针对是否感兴趣事件的个体)通常并不完美地平衡(即,数据中感兴趣事件的个体与不感兴趣事件的个体的代表性不等)。研究人员通常会纠正这种类别不平衡,但这类不平衡校正对机器学习模型校准的影响尚未为人所知。我们研究了不平衡校正对机器学习算法模型校准影响。通过大量蒙特卡罗模拟,我们比较了在不同数据生成情景(即不同样本大小、预测变量数量和事件比例)下,使用类别不平衡校正开发的模型与不使用类别不平衡校正开发的模型在样本外预测性能上的差异。我们以 MIMIC-III 数据中的一个案例研究来说明我们的发现。在所有模拟情景中,开发不进行类别不平衡校正的预测模型,始终在校准性能上等于或优于开发进行类别不平衡校正的预测模型。通过校正类别不平衡而引入的误校准 characterized by 对风险的高估,且总是无法通过校准来纠正。并非总是需要纠正类别不平衡,甚至可能对旨在在个体层面上产生可靠风险估计的临床预测模型造成 harm。

关键词

引用

@article{arxiv.2404.19494,
  title  = {The harms of class imbalance corrections for machine learning based prediction models: a simulation study},
  author = {Alex Carriero and Kim Luijken and Anne de Hond and Karel GM Moons and Ben van Calster and Maarten van Smeden},
  journal= {arXiv preprint arXiv:2404.19494},
  year   = {2024}
}