中文

面向含标签噪声多类不平衡数据的联合清洗与重采样算法

机器学习 2020-04-08 v1 机器学习

摘要

不平衡数据分类是现代数据分析面临的最关键任务之一。尤其当与其他困难因素(如噪声存在、类分布重叠和小不连通块)结合时,数据不平衡会显著影响分类性能。此外,已知某些数据困难因素会影响现有过采样策略(特别是 SMOTE 及其衍生方法)的性能。该影响在多类设定下尤为明显,其中类间的相互不平衡关系使问题更加复杂。尽管如此,当前不平衡数据领域的研究大多聚焦于二分类问题,而更困难的多类对应问题相对未被探索。本文提出一种新颖过采样技术——多类联合清洗与重采样(MC-CCR)算法。所提方法利用基于能量的方法建模适合过采样的区域,比 SMOTE 更少受小不连通块与离群点影响。它将其与同步清洗操作结合,旨在降低类分布重叠对学习算法性能的影响。最后,通过引入专门处理多类问题的策略,MC-CCR 比传统多类分解策略更少丢失类间关系信息。基于多个多类不平衡基准数据集的实验研究表明,所提方法对噪声具有高鲁棒性,且与最先进方法相比具有更高质量。

关键词

引用

@article{arxiv.2004.03406,
  title  = {Combined Cleaning and Resampling Algorithm for Multi-Class Imbalanced Data with Label Noise},
  author = {Michał Koziarski and Michał Woźniak and Bartosz Krawczyk},
  journal= {arXiv preprint arXiv:2004.03406},
  year   = {2020}
}