中文

Soft-IntroVAE:分析与改进内省变分自编码器

机器学习 2021-03-26 v2 人工智能 计算机视觉与模式识别

摘要

近期提出的内省变分自编码器(IntroVAE)展现出卓越的图像生成能力,并允许使用图像编码器进行摊销推断。IntroVAE 的主要思想是对 VAE 进行对抗式训练,利用 VAE 编码器来区分生成样本与真实数据样本。然而,原始的 IntroVAE 损失函数依赖于一种特定的铰链损失(hinge-loss)形式,在实践中极难稳定,且其理论收敛性分析忽略了损失中的重要项。在本工作中,我们朝着更好地理解 IntroVAE 模型、其实用实现及其应用迈出一步。我们提出 Soft-IntroVAE,一种改进的 IntroVAE,用对生成样本的平滑指数损失替代铰链损失项。这一改变显著改善了训练稳定性,并使得对完整算法的理论分析成为可能。有趣的是,我们证明 IntroVAE 收敛于最小化数据分布 KL 距离与一项熵之和的分布。我们讨论了该结果的含义,并证明其可诱导出具有竞争力的图像生成与重建。最后,我们描述了 Soft-IntroVAE 在无监督图像翻译与分布外检测中的两种应用,并展示了令人信服的结果。代码与附加信息可在项目网站获取——https://taldatech.github.io/soft-intro-vae-web

关键词

引用

@article{arxiv.2012.13253,
  title  = {Soft-IntroVAE: Analyzing and Improving the Introspective Variational Autoencoder},
  author = {Tal Daniel and Aviv Tamar},
  journal= {arXiv preprint arXiv:2012.13253},
  year   = {2021}
}

备注

CVPR 2021, Extended version. Code and additional information is available on the project website - https://taldatech.github.io/soft-intro-vae-web