中文

VTAE:基于流形学习的变分Transformer自编码器

计算机视觉与模式识别 2023-04-04 v1

摘要

深度生成模型已通过若干潜变量成功应用于学习非线性数据分布,这些模型使用非线性函数(生成器)将潜变量样本映射到数据空间。另一方面,生成器的非线性意味着潜空间对数据空间的投影不尽如人意,从而导致表征学习性能不佳。然而,这种薄弱的投影可通过黎曼度量加以改善,并且我们表明,在黎曼流形上计算测地线以及数据样本间的精确插值能够显著提升深度生成模型的性能。本文提出一种变分空间Transformer自编码器(VTAE),以最小化黎曼流形上的测地线并改进表征学习。具体而言,我们精心设计了带有编码空间Transformer的变分自编码器,将潜变量模型显式扩展到黎曼流形上的数据,并获得全局上下文建模。此外,为了在遍历两个不同对象的潜表示时获得平滑且合理的插值,我们提出了一种测地线插值网络,不同于现有使用性能较差的线性插值的模型。在基准数据集上的实验表明,我们所提出的模型在包括图像插值和重建在内的一系列计算机视觉任务上能够提升预测精度与通用性。

关键词

引用

@article{arxiv.2304.00948,
  title  = {VTAE: Variational Transformer Autoencoder with Manifolds Learning},
  author = {Pourya Shamsolmoali and Masoumeh Zareapoor and Huiyu Zhou and Dacheng Tao and Xuelong Li},
  journal= {arXiv preprint arXiv:2304.00948},
  year   = {2023}
}