利用具有加性高斯编码空间的变分自编码器生成多样且准确的图像描述
计算机视觉与模式识别
2017-11-21 v1
摘要
本文探讨使用条件变分自编码器(CVAE)生成图像描述。具有固定高斯先验的标准CVAE产生的描述变化过少。为此,我们提出两种模型,显式地将潜空间围绕对应于不同图像内容类型的 个分量进行结构化,并组合各分量以为同时包含多种内容类型(例如若干类物体)的图像创建先验。我们的第一个模型使用高斯混合模型(GMM)先验,而第二个模型定义了一种新颖的加性高斯(AG)先验,线性组合各分量均值。我们表明,两种模型生成的描述比强LSTM基线或具有固定高斯先验的“ vanilla”CVAE更多样且更准确,其中AG-CVAE尤其展现潜力。
引用
@article{arxiv.1711.07068,
title = {Diverse and Accurate Image Description Using a Variational Auto-Encoder with an Additive Gaussian Encoding Space},
author = {Liwei Wang and Alexander G. Schwing and Svetlana Lazebnik},
journal= {arXiv preprint arXiv:1711.07068},
year = {2017}
}