中文

通过自分解增强变分生成

计算机视觉与模式识别 2022-07-15 v2 神经与进化计算

摘要

本文引入拆分变分自编码器(SVAE)的概念,其输出 x^\hat{x} 由两个生成图像 x1^,x2^\hat{x_1},\hat{x_2} 的加权和 σx1^+(1σ)x2^\sigma \odot \hat{x_1} + (1-\sigma) \odot \hat{x_2} 得到,其中 σ\sigma 是一个习得的组合映射。组合图像 x1^,x2^\hat{x_1},\hat{x_2} 以及 σ\sigma 映射均由模型自动合成。该网络作为常规变分自编码器进行训练,在训练图像与重建图像之间采用负对数似然损失。对于 x1^,x2^\hat{x_1},\hat{x_2}σ\sigma 不需要额外的损失,也不需要任何形式的人工调参。该分解是不确定的,但遵循两种主要方案,我们可粗略归类为“句法”或“语义”。在第一种情况下,映射倾向于利用相邻像素之间的强相关性,将图像拆分为两个互补的高频子图像。在第二种情况下,映射通常聚焦于物体的轮廓,将图像拆分为其内容的有趣变体,具有更显著和更具区分性的特征。在这种情况下,根据经验观察,x1^\hat{x_1}x2^\hat{x_2} 的 Fréchet Inception Distance(FID)通常低于(因此优于)x^\hat{x} 的 FID,后者显然因取前两者的平均而受损。在某种意义上,SVAE 迫使变分自编码器做出选择,与其为最小化针对特定样本的重建损失而在备选方案间进行平均的内在倾向相反。根据 FID 指标,我们的技术在 Mnist、Cifar10 和 CelebA 等典型数据集上测试,使我们超越了所有先前纯粹的变分架构(不依赖归一化流)。

关键词

引用

@article{arxiv.2202.02738,
  title  = {Enhancing variational generation through self-decomposition},
  author = {Andrea Asperti and Laura Bugo and Daniele Filippini},
  journal= {arXiv preprint arXiv:2202.02738},
  year   = {2022}
}