基于对比学习与对抗学习的锚点过采样处理不平衡表格数据
机器学习
2025-03-25 v1 人工智能
摘要
不平衡数据表示某一类(多数类)的出现频率高于另一类(少数类)的分布。这种现象出现在各个领域中,例如安全、医疗和人类活动。在不平衡学习中,分类算法通常倾向于准确分类多数类,导致人为偏高的准确率。结果,许多少数类样本被错误标记为多数类实例,导致有利于多数类的偏差。本研究提出了一个基于边界锚点样本的框架,以应对不平衡学习的挑战。首先,我们选择并使用锚点样本来训练多层感知机 (MLP) 分类器,该分类器作为先验知识模型,辅助对抗和对比学习过程。然后,我们设计了一种新颖的深度生成模型,称为锚点稳定条件生成对抗网络,简称 Anch-SCGAN。Anch-SCGAN 配有两个分别针对少数类和多数类的生成器,以及一个结合了来自预训练特征提取器 MLP 的额外类特定信息的判别器。此外,我们通过两种方式促进生成器的训练过程。首先,我们基于重处理的锚点样本和对比学习定义了新的生成器损失函数。其次,我们应用评分策略来稳定生成器中的对抗训练部分。我们训练 Anch-SCGAN 并进一步用锚点样本对其进行微调,以提高生成样本的精度。我们在 16 个真实世界不平衡数据集上的实验表明,Anch-SCGAN 优于不平衡学习中著名的方法。
引用
@article{arxiv.2503.18569,
title = {Anchor-based oversampling for imbalanced tabular data via contrastive and adversarial learning},
author = {Hadi Mohammadi and Ehsan Nazerfard and Mostafa Haghir Chehreghani},
journal= {arXiv preprint arXiv:2503.18569},
year = {2025}
}