VITAL:基于对抗学习的文本视觉解释用于图像标注
计算机视觉与模式识别
2019-08-05 v2
摘要
在本文中,我们提出了一种新颖的方法来解释文本信息:通过从Text-to-image Generative Adversarial Network (GAN)生成的多个高分辨率、照片级真实感合成图像中提取视觉特征表示,以提升图像标注性能。首先,我们设计了一个堆叠式生成多对抗网络(Generative Multi-Adversarial Network, GMAN),即StackGMAN++,它是当前最先进的Text-to-image GAN——StackGAN++的改进版本,用于以文本为条件、带有不同先验噪声生成多个合成图像。然后我们从生成的合成图像中提取深度视觉特征,以探索文本背后的视觉概念。最后,我们将图像级视觉特征、文本级特征以及基于合成图像的视觉特征结合在一起来预测图像标签。我们在两个基准数据集上进行了实验,实验结果清楚地证明了我们提出方法的有效性。
引用
@article{arxiv.1907.11811,
title = {VITAL: A Visual Interpretation on Text with Adversarial Learning for Image Labeling},
author = {Tao Hu and Chengjiang Long and Leheng Zhang and Chunxia Xiao},
journal= {arXiv preprint arXiv:1907.11811},
year = {2019}
}