中文

基于不平衡数据学习评估框架(EFIDL)的实验研究

机器学习 2023-01-27 v1

摘要

引言 数据不平衡是少标签大数据分析中关键问题之一,例如真实世界医疗数据、垃圾邮件检测标签和金融欺诈检测数据集。许多数据平衡方法被提出以改善机器学习算法性能。研究声称 SMOTE 和基于 SMOTE 的数据增强(生成新数据点)方法能提升算法性能。然而,我们在许多在线教程中发现,评估方法基于合成数据集应用,给评估引入了偏差,性能得到虚假提升。在本研究中,我们提出了一种新的不平衡数据学习方法评估框架。我们针对五种数据平衡方法进行了实验,考察算法性能是否会提升。方法 我们从不同领域收集了 8 个具有不同不平衡率的不平衡医疗数据集。应用 6 种数据增强方法与 11 种机器学习方法,测试数据增强是否有助于提升机器学习性能。我们将传统数据增强评估方法与提出的交叉验证评估框架进行比较。结果 使用传统数据增强评估方法会给出性能改善的错觉。然而,我们提出的评估方法显示数据增强改善结果的能力有限。结论 EFIDL 更适用于在数据增强时评估机器学习方法的预测性能。使用不合适的评估框架会给出错误结果。未来研究者在处理增强数据集时应考虑我们提出的评估框架。我们的实验表明数据增强无助于改善机器学习预测性能。

关键词

引用

@article{arxiv.2301.10888,
  title  = {Experimenting with an Evaluation Framework for Imbalanced Data Learning (EFIDL)},
  author = {Chenyu Li and Xia Jiang},
  journal= {arXiv preprint arXiv:2301.10888},
  year   = {2023}
}