中文

S2IGAN:基于对抗学习的语音到图像生成

机器学习 2020-09-16 v2 计算与语言 计算机视觉与模式识别

摘要

据估计,世界上约有一半的语言没有书面形式,这使得这些语言无法从任何现有的基于文本的技术中受益。本文提出了一种语音到图像生成(S2IG)框架,该框架在不使用任何文本信息的情况下将语音描述翻译为照片级真实感图像,从而使无文字语言有可能从该技术中受益。所提出的S2IG框架名为S2IGAN,由一个语音嵌入网络(SEN)和一个关系监督的密集堆叠生成模型(RDG)组成。SEN在相应视觉信息的监督下学习语音嵌入。在SEN产生的语音嵌入的条件下,所提出的RDG合成与相应语音描述在语义上一致的图像。在两个公开基准数据集CUB和Oxford-102上的大量实验证明了所提出的S2IGAN在从语音信号合成高质量且语义一致的图像方面的有效性,为S2IG任务提供了良好的性能和坚实的基线。

关键词

引用

@article{arxiv.2005.06968,
  title  = {S2IGAN: Speech-to-Image Generation via Adversarial Learning},
  author = {Xinsheng Wang and Tingting Qiao and Jihua Zhu and Alan Hanjalic and Odette Scharenborg},
  journal= {arXiv preprint arXiv:2005.06968},
  year   = {2020}
}

备注

Accepted to Interspeech2020