中文

基于多模态信息瓶颈的无配对图像到语音合成

计算机视觉与模式识别 2019-08-21 v1

摘要

深度生成模型在文本到图像合成等跨模态生成方面取得了显著进展。训练这些模型通常需要具有模态间直接对应关系的配对数据。我们提出了一种利用两个其他模态共享的中间模态,在无配对数据情况下将实例从一种模态翻译到另一种模态的新问题。为展示这一点,我们选取了图像到语音翻译问题。在此情形下,可利用带有一个共享模态的不相交数据集,例如图像-文本对和文本-语音对,其中文本作为共享模态。我们称此问题为“跳跃模态生成”(skip-modal generation),因为在生成过程中跳过了共享模态。我们提出了一种多模态信息瓶颈方法,通过利用共享模态(文本)从非配对数据(图像和语音)中学习模态间的对应关系。我们解决了跳跃模态生成的基本挑战:1) 使用单一模型学习多模态表示,2) 弥合两个不相关数据集之间的领域差距,以及 3) 从非配对数据中学习模态间的对应关系。我们展示了图像到语音合成的定性结果;这是文献中首次报道此类结果。我们还表明,我们的方法在传统跨模态生成上提升了性能,表明其在解决单个任务时提高了数据效率。

关键词

引用

@article{arxiv.1908.07094,
  title  = {Unpaired Image-to-Speech Synthesis with Multimodal Information Bottleneck},
  author = {Shuang Ma and Daniel McDuff and Yale Song},
  journal= {arXiv preprint arXiv:1908.07094},
  year   = {2019}
}

备注

ICCV 2019