中文

欠采样后使用Platt缩放进行校准:局限性及应对方法

统计方法学 2024-12-06 v3 机器学习

摘要

当对响应变量为二分类且高度不平衡的数据进行建模时,通常会在建模前使用基于响应的抽样,即保留多数类的一个子集(即欠采样),以创建更平衡的训练数据集。然而,拟合到这些欠采样数据的模型(我们称之为基模型)会产生严重偏差的预测。有几种校准方法可用于对抗这种偏差,其中之一是Platt缩放。这里,使用逻辑回归模型来建模基模型原始预测与响应之间的关系。尽管Platt缩放在欠采样后校准模型中很流行,但它并非为此目的而设计。我们的工作提出了我们所认为的第一个关于在欠采样后使用Platt缩放进行校准有效性的详细研究。我们通过分析、模拟研究和案例研究证明,未经审慎思考,不应在欠采样后使用Platt缩放进行校准。如果Platt缩放能够在整个数据集上(即未欠采样)成功校准基模型,那么它可能适用于欠采样后的校准。如果不是这种情况,我们推荐一种修改版的Platt缩放,该版本将逻辑广义加性模型拟合到基模型预测的logit上,因为这种方法既有理论依据,又在我们研究考虑的各种设置中表现良好。

关键词

引用

@article{arxiv.2410.18144,
  title  = {Using Platt's scaling for calibration after undersampling -- limitations and how to address them},
  author = {Nathan Phelps and Daniel J. Lizotte and Douglas G. Woolford},
  journal= {arXiv preprint arXiv:2410.18144},
  year   = {2024}
}