中文

基于信息熵与轮盘赌选择的新型双重剪枝方法用于不平衡数据的乳腺癌诊断

机器学习 2025-03-18 v1 人工智能 信息论 math.IT

摘要

准确的疾病诊断对有效治疗和患者安全至关重要。机器学习模型广泛用于基于历史医学数据的癌症诊断。然而,数据不平衡仍然是一个主要挑战,阻碍了分类器的性能和可靠性。SMOTEBoost 方法通过生成合成数据来平衡数据集,但可能忽略决策边界附近的重叠区域,并可能产生噪声样本。本文提出了 RE-SMOTEBoost,这是 SMOTEBoost 的增强版本,旨在克服这些局限性。首先,RE-SMOTEBoost 侧重于使用轮盘赌选择在重叠区域生成合成样本,以更好地捕捉决策边界。其次,它结合了基于信息熵的过滤机制以减少噪声和边界案例,并提高生成数据的质量。第三,我们引入了双重正则化惩罚以控制合成样本与决策边界的接近程度并避免类别重叠。这些增强使得少数类的过采样质量更高,从而获得更平衡且更有效的训练数据集。所提方法在评估不平衡数据集时优于现有的最先进方法。与表现最好的采样算法相比,RE-SMOTEBoost 在准确率上展示了 3.22% 的显著提升,方差降低了 88.8%。这些结果表明,所提模型为医学环境提供了一个可靠的解决方案,有效克服了因样本有限、数据收集困难和隐私约束导致的数据稀缺和严重不平衡问题。

关键词

引用

@article{arxiv.2503.12239,
  title  = {A Novel Double Pruning method for Imbalanced Data using Information Entropy and Roulette Wheel Selection for Breast Cancer Diagnosis},
  author = {Soufiane Bacha and Huansheng Ning and Belarbi Mostefa and Doreen Sebastian Sarwatt and Sahraoui Dhelim},
  journal= {arXiv preprint arXiv:2503.12239},
  year   = {2025}
}