自监督图像到文本与文本到图像合成
计算机视觉与模式识别
2021-12-10 v1 计算与语言
机器学习
摘要
对视觉和语言及其相互关系的全面理解,对于认识这些模态之间的潜在相似性与差异并学习更泛化、更有意义的表示至关重要。近年来,大多数与文本到图像合成和图像到文本生成相关的工作集中于监督生成式深度架构来解决这些问题,很少关注跨模态嵌入空间之间相似性的学习。本文中,我们提出一种新颖的基于自监督深度学习的方法来学习跨模态嵌入空间;用于图像到文本和文本到图像生成两者。在我们的方法中,我们首先使用基于StackGAN的自编码器模型获得图像的稠密向量表示,并利用基于LSTM的文本自编码器获得句子级的稠密向量表示;然后我们利用基于GAN和最大均值差异的生成网络研究从一种模态的嵌入空间到另一种模态嵌入空间的映射。我们还从定性和定量上证明了我们的模型能够由图像数据生成文本描述,以及由文本数据生成图像。
引用
@article{arxiv.2112.04928,
title = {Self-Supervised Image-to-Text and Text-to-Image Synthesis},
author = {Anindya Sundar Das and Sriparna Saha},
journal= {arXiv preprint arXiv:2112.04928},
year = {2021}
}
备注
ICONIP 2021 : The 28th International Conference on Neural Information Processing