中文

面向不平衡数据的混合特征 Oversampling 方法:基于银行客户评分的应用

机器学习 2025-04-01 v1

摘要

本研究探讨了二分类任务中稀有事件检测中的混合特征问题。标准的不平衡处理技术包括 SMOTE(Synthetic Minority Over-sampling Technique),其针对连续型输入变量设计。尽管 SMOTE-NC 作为处理混合特征(连续型和分类型变量)的默认扩展方案,然而实际应用中鲜有研究提出针对混合特征的合成方法。值得注意的是,许多真实世界的分类任务(如银行领域)都涉及混合特征,对预测性能影响显著。为此,本文引入 MGS-GRF(Mixed Features Generation with Generalized Random Forest),一种专为混合特征设计的 Oversampling 策略。该方法利用核密度估计器(采用局部估计的满秩协方差矩阵)生成连续特征,同时通过广义随机森林从原始样本中抽取分类特征。经实验验证,与 SMOTE-NC 相比,MGS-GRF 具备两个关键特性:(i)一致性(coherence),即仅生成原始数据集中已存在的分类特征组合;(ii)关联性(association),即保持连续特征与分类特征之间的依赖关系。我们还评估了在多组数据集(包括模拟数据、公开真实数据集及来自领先金融机构的私有数据集)上,使用 MGS-GRF 等 various strategies 生成的合成样本训练的 LightGBM 分类器的预测性能。结果表明,具备一致性和关联性的合成方法在 PR 和 ROC AUC 等多项指标上表现更佳,其中 MGS-GRF 综合最优。此外,该方法在私有银行应用场景中显示出良好的性能,且符合监管约束要求。

关键词

引用

@article{arxiv.2503.22730,
  title  = {Harnessing Mixed Features for Imbalance Data Oversampling: Application to Bank Customers Scoring},
  author = {Abdoulaye Sakho and Emmanuel Malherbe and Carl-Erik Gauthier and Erwan Scornet},
  journal= {arXiv preprint arXiv:2503.22730},
  year   = {2025}
}