GAN 在极端类别不平衡下的死亡预测数据增强
机器学习
2025-10-21 v1
摘要
死亡预测是预防的关键,但具有足够阳性样本的真实数据稀缺,导致极端类别不平衡。我们利用机器学习(ML)构建模型并采用深度学习(DL)技术,如生成对抗网络(GAN),生成合成数据样本以增强数据集。初始数据集包含 656 个样本,其中仅有四个阳性案例,迫切需要数据增强。我们使用各种机器学习模型,从可解释的数据模型到黑箱算法模型进行测试。在真实测试数据上,Logistic 回归(LR)实现加权精确率为 0.99,加权召回率为 0.85,加权 F1 分数为 0.91;随机森林(RF)显示为 0.98、0.99 和 0.99;支持向量机(SVM)实现为 0.99、0.76 和 0.86。LR 和 SVM 正确识别了一个死亡尝试案例(灵敏度:1.0),并将 LR(20)和 SVM(31)非尝试误分类为尝试(特异度:0.85 与 0.76)。RF 在识别 0 个死亡尝试案例(灵敏度:0.0)时,特异度为 1.0,无假阳性。这些结果凸显了模型的有效性,GAN 在生成合成数据以支持死亡预防建模方发挥了关键作用。
引用
@article{arxiv.2510.17661,
title = {Handling Extreme Class Imbalance: Using GANs in Data Augmentation for Suicide Prediction},
author = {Vaishnavi Visweswaraiah and Tanvi Banerjee and William Romine},
journal= {arXiv preprint arXiv:2510.17661},
year = {2025}
}