中文

SeismoFlow——针对类不平衡问题的数据增强

计算机视觉与模式识别 2020-09-03 v2 机器学习

摘要

在医疗诊断、垃圾邮件过滤、欺诈检测和地震数据分析等若干应用领域中,经常会遇到某些类别出现频率很低的重要分类任务。这就是所谓的类不平衡问题,它是机器学习中的一项挑战。在这项工作中,我们提出 SeismoFlow,一种基于流的生成模型来创建合成样本,旨在解决类不平衡问题。受 Glow 模型启发,它利用在学到的潜空间上的插值来为某一稀有类生成合成样本。我们将我们的方法应用于地震图信号质量分类器的开发。我们引入了一个由 5.223 条地震图组成的数据集,这些地震图分布在良好、中等和差三类之中,其各自频率为 66.68%、31.54% 和 1.76%。我们的方法在分层 10 折交叉验证设置下进行评估,使用 Miniception 模型作为基线,并评估在每次迭代的训练集中添加生成样本的影响。在我们的实验中,稀有类 F1 分数提升了 13.9%,同时未损害其他类的指标值,从而观察到整体准确率的提升。我们的实证结果表明,我们的方法能够生成高质量、外观真实且多样性充足的合成地震图,以帮助 Miniception 模型克服类不平衡问题。我们相信我们的结果在推进地震图信号质量分类和类不平衡这两项任务上迈出了一步。

关键词

引用

@article{arxiv.2007.12229,
  title  = {SeismoFlow -- Data augmentation for the class imbalance problem},
  author = {Ruy Luiz Milidiú and Luis Felipe Müller},
  journal= {arXiv preprint arXiv:2007.12229},
  year   = {2020}
}

备注

10 pages