MixBoost:基于增强混合的合成过采样方法以应对极度不平衡
机器学习
2020-09-04 v1 机器学习
摘要
在一个类别的实例数量远超另一类别的数据集上训练分类模型是一个具有挑战性的问题。此类不平衡数据集在欺诈检测、医学诊断和计算广告等现实情形中十分常见。我们提出一种迭代式数据增强方法 MixBoost,它智能地选择(Boost)并随后组合(Mix)多数类与少数类的实例,以生成兼具两类特征的合成混合实例。我们在 20 个基准数据集上评估 MixBoost,表明其优于现有方法,并通过显著性检验测试其有效性。我们还进行了消融研究以分析 MixBoost 各组成部分的影响。
引用
@article{arxiv.2009.01571,
title = {MixBoost: Synthetic Oversampling with Boosted Mixup for Handling Extreme Imbalance},
author = {Anubha Kabra and Ayush Chopra and Nikaash Puri and Pinkesh Badjatiya and Sukriti Verma and Piyush Gupta and Balaji K},
journal= {arXiv preprint arXiv:2009.01571},
year = {2020}
}
备注
Work done as part of internship at MDSR