中文

不平衡信用数据上变量离散化与代价敏感逻辑回归的描述性研究

应用统计 2019-07-29 v2 机器学习

摘要

在不平衡数据上训练分类模型往往导致偏向多数类的偏差。本文中,我们展示变量离散化与代价敏感逻辑回归如何在一份不平衡信用评分数据集上缓解此偏差,并进一步展示该变量离散化技术在其他领域数据上的应用,证明其作为超越信用评分的不平衡数据分类通用技术的潜力。性能度量包括 ROC 曲线、ROC 曲线下面积 (AUC)、第一类错误、第二类错误、准确率与 F1 分数。结果表明,恰当的变量离散化与具有最佳类权重的代价敏感逻辑回归可降低模型偏差和/或方差。从算法角度看,代价敏感逻辑回归有益于提升预测变量的值,即使其未处于优化形式而仍保持单调性。从预测变量角度看,变量离散化表现优于代价敏感逻辑回归,对与经验 logit 呈非线性关系的预测变量提供更合理的系数估计,且对由先验比例确定的事件与非事件误分类惩罚权重具有鲁棒性。

关键词

引用

@article{arxiv.1812.10857,
  title  = {A Descriptive Study of Variable Discretization and Cost-Sensitive Logistic Regression on Imbalanced Credit Data},
  author = {Lili Zhang and Herman Ray and Jennifer Priestley and Soon Tan},
  journal= {arXiv preprint arXiv:1812.10857},
  year   = {2019}
}

备注

Journal of Applied Statistics (2019)