中文

利用持续同调可视化自编码器在信用卡交易上的训练

机器学习 2019-08-13 v2 机器学习

摘要

自编码器是用于降维最流行的神经网络架构之一。它们由两部分组成:将模型分布映射到潜在流形的编码器,以及将潜在流形映射到重构分布的解码器。然而,已知自编码器会在潜在流形中引发混沌散布的数据分布,导致不完整的重构分布。当前的度量距离无法发现这一问题,因为它们不能识别数据流形的形状(即其拓扑特征)以及应分析流形的尺度。我们提出用于Wasserstein自编码器的持续同调(称为PHom-WAE),一种评估和度量生成模型数据流形的新方法。PHom-WAE最小化真实分布与重构分布之间的Wasserstein距离,并利用持续同调(在不同空间分辨率下研究空间的拓扑特征)来比较潜在流形与重构分布的性质。我们的实验强调了持续同调用于Wasserstein自编码器相较于另一种生成模型——变分自编码器的潜力。实验在一个对传统距离度量和自编码器尤其具有挑战性的真实世界数据集上进行。PHom-WAE是首个提出拓扑距离度量(瓶颈距离)用于Wasserstein自编码器的方法,以在信用卡交易背景下比较高质量的解码样本。

关键词

引用

@article{arxiv.1905.13020,
  title  = {Visualization of AE's Training on Credit Card Transactions with Persistent Homology},
  author = {Jeremy Charlier and Francois Petit and Gaston Ormazabal and Radu State and Jean Hilger},
  journal= {arXiv preprint arXiv:1905.13020},
  year   = {2019}
}

备注

arXiv admin note: substantial text overlap with arXiv:1905.09894