中文

带收缩与样条分箱的证据权重 2.0

机器学习 2021-09-27 v3 机器学习

摘要

在许多实际应用中,如欺诈检测、信用风险建模或医疗决策,需要将实例分配到预定义类别的分类模型既精确又可解释。线性建模方法如逻辑回归常被采用,因为它们在精度与可解释性之间提供了可接受的平衡。然而,线性方法不擅长处理高基数的类别型预测变量或利用数据中的非线性关系。作为解决方案,诸如证据权重(weight-of-evidence)等数据预处理方法通常用于变换预测变量。但证据权重方法背后的分箱过程很少被研究,且通常依赖于临时或专家驱动的程序。因此,本文的目标是提出一种形式化、数据驱动且强大的方法。为此,我们探索通过样条函数分箱对连续变量进行离散化,这能够捕捉预测变量中的非线性效应,并产生仅取少量离散值且高度可解释的预测变量。此外,我们扩展了证据权重方法,并提出使用收缩估计量来估计比例。总之,这提供了改进的能力,以利用非线性和类别型预测变量来实现更高的分类精度,同时保持所得模型的可解释性并降低过拟合风险。我们展示了在欺诈检测场景下一系列实验的结果,说明了所提方法的有效性。我们通过提供用于实现实验及所提方法的数据集和代码,促进所呈现结果的复现与所提方法的采用。

关键词

引用

@article{arxiv.2101.01494,
  title  = {Weight-of-evidence 2.0 with shrinkage and spline-binning},
  author = {Jakob Raymaekers and Wouter Verbeke and Tim Verdonck},
  journal= {arXiv preprint arXiv:2101.01494},
  year   = {2021}
}

备注

New version: duplicate paragraph omitted