基于生成对抗网络的音频到场景图像合成
计算与语言
2018-08-14 v1 计算机视觉与模式识别
声音
音频与语音处理
摘要
人类可以从声音想象出一个场景。我们希望机器通过使用条件生成对抗网络(GANs)来做到这一点。通过应用谱归一化、投影判别器和辅助分类器等技术,与朴素条件 GAN 相比,该模型在主观和客观评价两方面均能生成质量更好的图像。近四分之三的人认同我们的模型具备生成与声音相关图像的能力。通过输入同一声音的不同音量,我们的模型基于音量输出不同尺度的变化,表明我们的模型在某种程度上真正知晓声音与图像之间的关系。
引用
@article{arxiv.1808.04108,
title = {Towards Audio to Scene Image Synthesis using Generative Adversarial Network},
author = {Chia-Hung Wan and Shun-Po Chuang and Hung-Yi Lee},
journal= {arXiv preprint arXiv:1808.04108},
year = {2018}
}