rebalancing the scales: 针对数据不平衡问题应用生成对抗网络 (GANs) 的系统性映射研究
人工智能
2025-02-25 v1 机器学习
摘要
机器学习算法用于各种领域,许多领域面临数据不平衡的重大挑战。研究探索了各种方法来解决该问题,如数据预处理、成本敏感学习和集成方法。生成对抗网络 (GAN) 作为数据预处理技术的潜力被证明可以生成高质量的合成数据。本研究采用系统性映射方法分析 3041 篇关于 GAN 基于抽样技术用于不平衡数据的论文,来源于四个数字图书馆。过滤过程识别了 100 项关键研究,涵盖医疗保健、金融和网络安全等领域。通过全面的定量分析,本研究引入了三种分类映射作为应用域、GAN 技术和用于处理数据不平衡性质的 GAN 变体。GAN 基于的过采样方法表现为一种有效的预处理方法。高级架构和量身定制的框架帮助 GAN 在数据不平衡的情况下进一步提高性能。Vanilla GAN、CTGAN 和 CGAN 等 GAN 变体在结构化不平衡数据案例中表现出极大的适应性。对于不平衡数据的 GAN 兴趣大幅增长,近年来达到高峰,期刊和会议在传递基础理论和实际应用方面发挥着关键作用。尽管有了这些进步,本文中审阅的研究中没有一个显式探索 GAN 框架与扩散模型或强化学习技术的混合方法。这一空白导致我们提出未来研究的想法:开发创新方法来有效处理数据不平衡。
引用
@article{arxiv.2502.16535,
title = {Rebalancing the Scales: A Systematic Mapping Study of Generative Adversarial Networks (GANs) in Addressing Data Imbalance},
author = {Pankaj Yadav and Gulshan Sihag and Vivek Vijay},
journal= {arXiv preprint arXiv:2502.16535},
year = {2025}
}
备注
49 pages, 6 figures