中文

基于虚拟大数据投影的Stable不平衡数据分类方法

机器学习 2020-09-18 v1 机器学习

摘要

虚拟大数据(Virtual Big Data, VBD)在最近被证明能有效缓解生成对抗神经网络(Generative Adversarial Neural Networks, GANs)的两大主要问题,即模式崩溃与生成器梯度消失。在本文中,我们探究VBD解决机器学习中另两个主要挑战的能力,包括深度自编码器训练与不平衡数据分类。首先,我们证明VBD可通过提供海量多样化训练数据显著减小自编码器的验证损失,而这是实现更好泛化以最小化过拟合问题的关键。其次,我们利用VBD提出首个称为交叉拼接的基于投影的方法,以在不进行过采样的情况下平衡偏斜的类别分布。我们证明交叉拼接能解决数据驱动方法在不平衡分类中的不确定性问题。

关键词

引用

@article{arxiv.2009.08387,
  title  = {Towards Stable Imbalanced Data Classification via Virtual Big Data Projection},
  author = {Hadi Mansourifar and Weidong Shi},
  journal= {arXiv preprint arXiv:2009.08387},
  year   = {2020}
}