带噪声生成器的端到端 Sinkhorn 自编码器
机器学习
2020-06-15 v1 机器学习
摘要
在这项工作中,我们提出了一种新颖的带噪声生成器的端到端 Sinkhorn 自编码器,用于高效的数据采集模拟。旨在收集实验数据的模拟过程对于包括核医学、天文学和高能物理在内的多种实际应用至关重要。当代方法(如蒙特卡洛算法)以高计算成本为代价提供高保真结果。人们已做出多种尝试来减轻这一负担,例如使用基于生成对抗网络或变分自编码器的生成式方法。尽管这类方法速度快得多,但它们在训练中往往不稳定,且不允许从整个数据分布中采样。为解决这些缺陷,我们引入了一种称为端到端 Sinkhorn 自编码器的新方法,该方法利用 Sinkhorn 算法显式对齐编码真实数据样本与生成噪声的分布。更确切地说,我们扩展了自编码器架构,增加一个确定性神经网络,训练其将来自已知分布的噪声映射到表示数据分布的自编码器潜空间。我们联合优化整个模型。我们的方法在 LHC 中 ALICE 实验零度量能器的具有挑战性的模拟数据集以及 MNIST 和 CelebA 等标准基准上均优于竞争方法。
引用
@article{arxiv.2006.06704,
title = {End-to-end Sinkhorn Autoencoder with Noise Generator},
author = {Kamil Deja and Jan Dubiński and Piotr Nowak and Sandro Wenzel and Tomasz Trzciński},
journal= {arXiv preprint arXiv:2006.06704},
year = {2020}
}