用于图像-文本联合建模的变分异编码器随机化 GAN
计算机视觉与模式识别
2020-01-09 v3 计算与语言
机器学习
机器学习
摘要
针对双向联合图像-文本建模,我们提出了变分异编码器(VHE)随机化生成对抗网络(GAN),这是一种将概率文本解码器、概率图像编码器和 GAN 集成到一个连贯的端到端多模态学习框架中的通用深度生成模型。VHE 随机化 GAN(VHE-GAN)对图像进行编码以解码其关联文本,并将变分后验作为随机性来源输入 GAN 图像生成器。我们将深度主题模型、阶梯结构图像编码器和 StackGAN++ 三个现成模块接入 VHE-GAN,其已取得了具有竞争力的性能。这进一步推动了 VHE-raster-scan-GAN 的发展,该模型不仅能以多尺度低到高分辨率的方式,还能以层次语义粗到细的方式生成照片级真实图像。通过端到端训练捕获并关联层次语义与视觉概念,VHE-raster-scan-GAN 在多种图像-文本多模态学习与生成任务中达到了最先进的性能。
引用
@article{arxiv.1905.08622,
title = {Variational Hetero-Encoder Randomized GANs for Joint Image-Text Modeling},
author = {Hao Zhang and Bo Chen and Long Tian and Zhengjue Wang and Mingyuan Zhou},
journal= {arXiv preprint arXiv:1905.08622},
year = {2020}
}
备注
ICLR 2020