中文

数据平衡策略:抽样与增强方法的系统综述

机器学习 2026-04-30 v2 人工智能 机器学习

摘要

不平衡数据集(即一类显著多于其他类的特征)仍是机器学习中的持久挑战,常导致预测偏向多数类并降低分类器性能。本文提供了数据平衡方法的全面、系统性综述,涵盖了从基础的过采样技术(如合成少数类过采样技术SMOTE及其变体,如Borderline SMOTE、K-Means SMOTE和Safe-Level SMOTE)到高级自适应方法(MWMOTE、AMDO),再到深度生成模型(生成对抗网络、变分自编码器和扩散模型),以及欠采样技术(NearMiss、Tomek链接),以及组合/混合方法(SMOTE-ENN、SMOTE-Tomek和SMOTE+OCSVM),以及集成策略(SMOTEBoost、RUSBoost、Balanced Random Forest和One-Sided Selection),以及针对多标签和聚类数据的专用方法。除描述性分类外,本综述还批判性地检视了每种方法的 underlying 假设、操作机制及其适用于不同数据特征的适Suitability,包括高维度、混合特征类型、类别重叠和噪声。关键发现表明,没有单一方法在所有情况下均优于其他方法;最佳选择严重依赖于数据集特征、分类器选择和评估指标。本文 concludes by identifying emerging research directions, including self-supervised learning for imbalance, diffusion-based generative oversampling, distribution-preserving resampling, knowledge distillation for imbalanced deployment, and the adaptation of foundation models to skewed distributions, offering practical guidelines for practitioners and a roadmap for future methodological development.

关键词

引用

@article{arxiv.2505.13518,
  title  = {Data Balancing Strategies: A Systematic Survey of Resampling and Augmentation Methods},
  author = {Behnam Yousefimehr and Mehdi Ghatee and Javad Fazli and Shervin Ghaffari and Zahra Rafei and Mohammad Amin Seifi and Sajed Tavakoli and Abolfazl Nikahd and Mahdi Razi Gandomani and Alireza Orouji and Ramtin Mahmoudi Kashani and Sarina Heshmati and Negin Sadat Mousavi},
  journal= {arXiv preprint arXiv:2505.13518},
  year   = {2026}
}