中文

对抗过采样对我们有帮助吗

机器学习 2021-08-25 v1 人工智能

摘要

传统过采样方法通常用于处理数据集中的类别不平衡。该过采样方法与分类器无关,因而无法提供端到端解决方案。为克服此点,我们提出一种基于三方对抗博弈的端到端方法,其中使用域约束的生成器混合、一个判别器与一个多类分类器。我们提出对抗过采样(AO)与数据空间过采样(DO)方法,而非对抗性少数类过采样。在 AO 中,生成器通过同时欺骗分类器与判别器来更新;而在 DO 中,其通过有利于分类器并欺骗判别器来更新。更新分类器时,AO 中同时考虑真实与合成生成样本;但 DO 中其有利于真实样本并欺骗子集类特定的生成样本。为缓解分类器对多数类的偏置,少数类样本以分数比率过采样。此种实现被证明可提供更鲁棒的分类边界。我们方法的有效性已通过高维、高度不平衡且大规模多类表格数据集得到验证。以平均类特定准确率(ACSA)衡量的结果清晰表明,相较基线分类器,所提方法提供了更好的分类准确率(提升幅度介于 0.7% 至 49.27% 之间)。

关键词

引用

@article{arxiv.2108.10697,
  title  = {Does Adversarial Oversampling Help us?},
  author = {Tanmoy Dam and Md Meftahul Ferdaus and Sreenatha G. Anavatti and Senthilnath Jayavelu and Hussein A. Abbass},
  journal= {arXiv preprint arXiv:2108.10697},
  year   = {2021}
}

备注

Paper accepted in CIKM 2021