视觉基础想象力的生成模型
机器学习
2018-11-12 v8 计算机视觉与模式识别
机器学习
摘要
人们很容易想象一个粉色头发男子的模样,即使他们从未见过这样的人。我们将这种创造新颖语义概念图像的能力称为视觉基础想象力。本文展示了如何修改变分自编码器来执行这一任务。我们的方法使用了一个新颖的训练目标和一个新颖的专家乘积推理网络,该网络能够以有原则且高效的方式处理部分指定(抽象)的概念。我们还提出了一套易于计算的评估指标,这些指标捕捉了我们关于良好视觉想象力意味着什么的直觉概念,即正确性、覆盖率和组合性(3C)。最后,我们将我们的方法与两种现有的联合图像-属性VAE方法(Suzuki等人的JMVAE方法和Wang等人的BiVCCA方法)进行了详细比较,并将它们应用于两个数据集:带属性的MNIST数据集(我们在此引入)和CelebA数据集。
引用
@article{arxiv.1705.10762,
title = {Generative Models of Visually Grounded Imagination},
author = {Ramakrishna Vedantam and Ian Fischer and Jonathan Huang and Kevin Murphy},
journal= {arXiv preprint arXiv:1705.10762},
year = {2018}
}
备注
International Conference on Learning Representations (ICLR), 2018