通过对抗反向传播的图文多模态表示学习
计算机视觉与模式识别
2016-12-28 v1 计算与语言
机器学习
摘要
我们提出了一种用于图文多模态表示学习的新方法。据我们所知,这项工作是将对抗学习概念应用于多模态学习、且不利用图文对信息来学习多模态特征的首个方法。与以往大多数使用图文对信息进行多模态嵌入的方法不同,我们仅使用类别信息。在本文中,我们证明了在没有图文对信息的情况下也能获得多模态特征,并且与使用图文对信息的方法相比,我们的方法在多模态特征空间中使得图像和文本的分布更为相似。我们还表明,即使我们的多模态特征是为类别预测而训练的,它也具有通用语义信息。我们的模型是端到端反向传播的,直观且易于扩展到其他多模态学习任务中。
引用
@article{arxiv.1612.08354,
title = {Image-Text Multi-Modal Representation Learning by Adversarial Backpropagation},
author = {Gwangbeen Park and Woobin Im},
journal= {arXiv preprint arXiv:1612.08354},
year = {2016}
}
备注
8 pages, 5 figures