中文

Fusion-S2iGan:一种高效且有效的语音转图像生成单阶段框架

计算机视觉与模式识别 2023-05-18 v1 多媒体

摘要

语音转图像转换的目标是直接从语音信号生成逼真的图像。近期,各种研究关注该任务并取得了令人期待的性能。然而,当前的语音转图像方法基于堆叠的模块化框架,存在三个关键问题:1)训练独立的网络既耗时又低效,且最终生成模型的收敛严重依赖于前序生成器;2)该架构忽略了前驱图像的质量;3)需要训练多个判别器网络。为此,我们提出了一种高效且有效的单阶段框架Fusion-S2iGan,以根据给定的语音描述生成视觉上合理且语义一致的图像样本。Fusion-S2iGan引入了视觉+语音融合模块(VSFM),该模块由像素注意力模块(PAM)、语音调制模块(SMM)和加权融合模块(WFM)构成,用于将来自语音编码器的语音嵌入注入生成器,同时提高合成图像的质量。Fusion-S2iGan将双模态信息分布到生成器网络的所有层,以增强架构中不同层级层次的视觉特征图。我们在四个基准数据集上进行了系列实验,即CUB birds、Oxford-102、Flickr8k和Places-subset。实验结果表明,与具有多阶段架构的SOTA模型相比,所提出的Fusion-S2iGan具有优越性,且性能接近传统的文本转图像方法。

关键词

引用

@article{arxiv.2305.10126,
  title  = {Fusion-S2iGan: An Efficient and Effective Single-Stage Framework for Speech-to-Image Generation},
  author = {Zhenxing Zhang and Lambert Schomaker},
  journal= {arXiv preprint arXiv:2305.10126},
  year   = {2023}
}