中文

用于图像、标签和字幕深度学习的变分自编码器

机器学习 2016-09-29 v1 机器学习

摘要

开发了一种新型变分自编码器,用于对图像及其关联的标签或字幕进行建模。采用深度生成反卷积网络(DGDN)作为潜在图像特征的解码器,采用深度卷积神经网络(CNN)作为图像编码器;该 CNN 用于近似潜在 DGDN 特征/代码的分布。潜在代码还与标签的生成模型(贝叶斯支持向量机)或字幕的生成模型(循环神经网络)相连接。在测试阶段预测新图像的标签/字幕时,会对潜在代码的分布进行平均;由于采用了基于学习得到的 CNN 编码器,这一过程计算效率很高。由于该框架能够在存在或不存在关联标签/字幕的情况下对图像进行建模,因此为带有图像的 CNN 学习展现了一种新的半监督设置;该框架甚至允许仅基于图像的无监督 CNN 学习。

关键词

引用

@article{arxiv.1609.08976,
  title  = {Variational Autoencoder for Deep Learning of Images, Labels and Captions},
  author = {Yunchen Pu and Zhe Gan and Ricardo Henao and Xin Yuan and Chunyuan Li and Andrew Stevens and Lawrence Carin},
  journal= {arXiv preprint arXiv:1609.08976},
  year   = {2016}
}

备注

NIPS 2016 (To appear)