基于 GAN 的数据增强以解决类不平衡
机器学习
2022-06-14 v1 人工智能
摘要
随着技术发展与人们对其的利用,信用卡欺诈数量不断增长。因此,实施稳健有效的方法检测此类欺诈极为重要。机器学习算法适于这些任务,因其试图最大化预测准确率从而可被信赖。然而存在一个迫近的缺陷:机器学习模型可能因样本集内类分布不平衡而表现不佳。故在许多相关任务中,数据集所含观测到的欺诈案例极少(有时仅约 1% 正欺诈实例)。因此,这种不平衡的存在可能使任何学习模型将所有标签预测为多数类,从而令模型预测无泛化空间。我们训练了生成对抗网络(GAN)以生成大量可信(且可靠)的少数类合成样本,用以缓解训练集内的类不平衡,从而更有效地泛化数据学习。
引用
@article{arxiv.2206.05840,
title = {GAN based Data Augmentation to Resolve Class Imbalance},
author = {Sairamvinay Vijayaraghavan and Terry Guan and Jason and Song},
journal= {arXiv preprint arXiv:2206.05840},
year = {2022}
}