中文

基于几何信息采样与类优先级合成数据生成处理多类不平衡数据的方法(GICaPS)

机器学习 2020-10-13 v1 机器学习

摘要

本文研究多标签分类问题中不平衡数据的处理。该问题通过提出两种主要利用特征向量间几何关系的新方法来解决。第一种是基于特征向量间夹角的欠采样算法,用于筛选信息量更大的样本并剔除信息量较小的样本,并给出了定义给定样本信息量的合适准则。第二种是基于生成算法的过采样算法,用于创建尊重所有类边界的新合成数据,这是通过基于特征向量间欧氏距离寻找“无人区”来实现的。所提方法的有效性通过基于高斯混合的通用多类识别问题进行分析。在十个展现高至极度数据不平衡的公开数据集上,通过与包括 SMOTE 和 ADASYN 在内的其他前沿方法比较,确立了所提算法的优越性。这两种方法被组合为一个统一的数据处理框架,标记为“GICaPS”,以突显基于几何的信息(GI)采样与类优先级合成(CaPS)在处理多类数据不平衡问题中的作用,从而在该领域作出新颖贡献。

关键词

引用

@article{arxiv.2010.05155,
  title  = {A Method for Handling Multi-class Imbalanced Data by Geometry based Information Sampling and Class Prioritized Synthetic Data Generation (GICaPS)},
  author = {Anima Majumder and Samrat Dutta and Swagat Kumar and Laxmidhar Behera},
  journal= {arXiv preprint arXiv:2010.05155},
  year   = {2020}
}