CopulaSMOTE:基于Copula的非平衡分类数据增强方法用于糖尿病预测
机器学习
2026-05-26 v3 应用统计
机器学习
摘要
类别不平衡在糖尿病等临床预测模型开发中仍是实际难题,因为确诊病例数量常远小于对照组数量。合成少数类过采样技术(SMOTE)及其变体广泛用于解决此不平衡问题,但它们通过特征空间的局部插值生成合成观测数据,未显式建模少数类的联合依赖结构。为此,本研究引入一种基于Copula的数据增强方法,在生成样本时估计少数类的依赖结构,并与标准机器学习技术集成。具体而言,我们采用截断Vine Copula通过一系列二元构建模块表示多变量依赖性。我们在三个公开糖尿病数据集上进行评估,即Pima印度人糖尿病数据集、伊拉克糖尿病数据集和CDC BRFSS 2015糖尿病健康指标数据集,后者涵盖不同样本规模、维度和不平衡情形。对于每个数据集,比较五种重采样策略在五个分类器上的表现,采用Detterich的配对t检验进行5×2交叉验证。我们的发现表明,CopulaSMOTE可在较大表格糖尿病数据集上提升少数类恢复,特别是CDC BRFSS数据集,但其优势取决于分类器和评估指标。
引用
@article{arxiv.2506.17326,
title = {CopulaSMOTE: A Copula-Based Oversampling Approach for Imbalanced Classification in Diabetes Prediction},
author = {Agnideep Aich and Md Monzur Murshed and Bruce Wade and Sameera Hewage},
journal= {arXiv preprint arXiv:2506.17326},
year = {2026}
}