中文

利用蒙特卡洛丢弃法生成数据

机器学习 2019-09-17 v2 机器学习

摘要

对于许多分析问题,挑战在于处理海量可用数据。然而,在一些数据科学应用领域,信息收集困难且成本高昂,例如地质现象、罕见疾病、复杂系统故障、保险欺诈等的研究。在许多此类情况下,具有与实际数据相同统计和预测性质的合成数据生成器可实现高效仿真以及工具和应用的开发。本工作中,我们提出在自编码器(MCD-AE)和变分自编码器(MCD-VAE)中引入蒙特卡洛丢弃(Monte Carlo Dropout)方法,作为合成数据集的高效生成器。由于变分自编码器(VAE)是最流行的生成技术之一,我们探讨了其与所提方法的异同。我们基于统计性质、结构相似性和预测相似性,将生成的数据集与原始数据进行比较。所得结果表明,VAE、MCD-VAE和MCD-AE的结果高度相似;但所提方法更快,且能生成与特定选定初始样本相似的值。

关键词

引用

@article{arxiv.1909.05755,
  title  = {Generating Data using Monte Carlo Dropout},
  author = {Kristian Miok and Dong Nguyen-Doan and Daniela Zaharie and Marko Robnik-Šikonja},
  journal= {arXiv preprint arXiv:1909.05755},
  year   = {2019}
}