中文

SMOTE生成样本的理论收敛性

机器学习 2026-01-06 v1 人工智能

摘要

不平衡数据影响从医疗保健到网络安全的广泛机器学习应用。由于SMOTE是解决此问题最流行的方法之一,因此不仅要经验性地验证它,还要进行理论验证。本文对SMOTE的收敛性提供了严格的理论分析。具体而言,我们证明了合成随机变量Z与底层随机变量X在概率意义下收敛。进一步证明当X紧凑时,收敛于均值的更强收敛。最后,我们表明最近邻秩值较小会导致更快的收敛,为实践者提供了可操作的指导。理论结果通过使用真实数据和合成数据的数值实验得到支持。我们的工作提供了基础性理解,提升了不平衡数据场景之外的数据增强技术。

关键词

引用

@article{arxiv.2601.01927,
  title  = {Theoretical Convergence of SMOTE-Generated Samples},
  author = {Firuz Kamalov and Hana Sulieman and Witold Pedrycz},
  journal= {arXiv preprint arXiv:2601.01927},
  year   = {2026}
}