中文

面向不平衡数据集学习的广义过采样方法及其相关理论

机器学习 2023-08-08 v1 机器学习

摘要

在监督学习中,经常会遇到真实的不平衡数据集。这种情况给标准算法带来了学习困难。不平衡学习的研究与解决方案主要集中在分类任务上。尽管其重要性,针对不平衡回归的解决方案极少。本文提出一种基于核密度估计的数据增强过程——GOLIATH 算法,可用于分类与回归。该通用方法涵盖了两大类合成过采样:基于扰动的方法(如高斯噪声)与基于插值的方法(如 SMOTE)。它还给出了这些机器学习算法的显式形式及其条件密度的表达式,特别是 SMOTE 的。由此推导出新的合成数据生成器。我们将 GOLIATH 应用于不平衡回归,将此类生成器过程与目标值的 wild-bootstrap 重采样技术相结合。我们在不平衡回归情形下评估了 GOLIATH 算法的性能。我们通过实证评估并比较了我们的方法,证明相较现有最先进的技术有显著改进。

关键词

引用

@article{arxiv.2308.02966,
  title  = {Generalized Oversampling for Learning from Imbalanced datasets and Associated Theory},
  author = {Samuel Stocksieker and Denys Pommeret and Arthur Charpentier},
  journal= {arXiv preprint arXiv:2308.02966},
  year   = {2023}
}

备注

This paper focuses specifically on the Imbalanced Regression issues but could be used for Imbalanced classification tasks