中文

M3D-GAN:基于通用注意力的多模态多域翻译

计算机视觉与模式识别 2019-07-11 v1 计算与语言 机器学习 音频与语音处理 图像与视频处理

摘要

生成对抗网络(GAN)已在跨模态/域翻译方面取得了显著进展。然而,这些网络通常针对特定任务设计(例如对话生成或图像合成,但不能同时兼顾)。我们提出了一种统一模型 M3D-GAN,可在广泛的模态(例如文本、图像和语音)与域(例如图像中的属性或语音中的情感)之间进行翻译。我们的模型由将不同模态数据转换为统一表示的模态子网络,以及不同模态数据共享同一网络架构的统一计算主体组成。我们引入了通用注意力模块,其与整个网络联合训练,并学习将大范围的域信息编码到高度结构化的潜空间中。我们以新颖的方式利用它来控制合成,例如从草图生成多样的逼真图片或改变合成语音的情感。我们在广泛基准任务上评估了我们的方法,包括图像到图像、文本到图像、图像描述、文本到语音、语音识别和机器翻译。我们的结果显示在某些任务上达到了最先进(SOTA)性能。

关键词

引用

@article{arxiv.1907.04378,
  title  = {M3D-GAN: Multi-Modal Multi-Domain Translation with Universal Attention},
  author = {Shuang Ma and Daniel McDuff and Yale Song},
  journal= {arXiv preprint arXiv:1907.04378},
  year   = {2019}
}