面向不平衡数据的多粒度重标记欠采样算法
机器学习
2022-01-12 v1
摘要
不平衡分类问题已成为数据挖掘与机器学习中重要且具有挑战性的问题之一。传统分类器的性能会受到诸多数据问题的严重影响,例如类不平衡问题、类重叠与噪声。Tomek-Link 算法在提出时仅用于清洗数据。近年来,已有将 Tomek-Link 算法与采样技术相结合的报道。Tomek-Link 采样算法能有效减少数据的类重叠,移除难以区分的多数类样本,并提高算法分类精度。然而,Tomek-Links 欠采样算法仅考虑全局上互为最近邻的边界样本,忽略了潜在的局部重叠样本。当少数类样本数量较少时,欠采样效果不尽如人意,分类模型的性能提升也不明显。因此,在 Tomek-Link 基础上,提出一种多粒度重标记欠采样算法(MGRU)。该算法在局部粒度子空间中充分考虑数据集的局部信息,检测数据集中局部的潜在重叠样本。然后,依据全局重标记指数值剔除重叠的多数类样本,有效扩展了 Tomek-Links 的检测范围。仿真结果表明,当我们选取最优全局重标记指数值进行欠采样时,所提欠采样算法的分类精度与泛化性能显著优于其他基线算法。
引用
@article{arxiv.2201.03957,
title = {Multi-granularity Relabeled Under-sampling Algorithm for Imbalanced Data},
author = {Qi Dai and Jian-wei Liu and Yang Liu},
journal= {arXiv preprint arXiv:2201.03957},
year = {2022}
}
备注
35 pages