M3D-GAN:基于通用注意力的多模态多域翻译
计算机视觉与模式识别
2019-07-11 v1 计算与语言
机器学习
音频与语音处理
图像与视频处理
摘要
生成对抗网络(GAN)已在跨模态/域翻译方面取得了显著进展。然而,这些网络通常针对特定任务设计(例如对话生成或图像合成,但不能同时兼顾)。我们提出了一种统一模型 M3D-GAN,可在广泛的模态(例如文本、图像和语音)与域(例如图像中的属性或语音中的情感)之间进行翻译。我们的模型由将不同模态数据转换为统一表示的模态子网络,以及不同模态数据共享同一网络架构的统一计算主体组成。我们引入了通用注意力模块,其与整个网络联合训练,并学习将大范围的域信息编码到高度结构化的潜空间中。我们以新颖的方式利用它来控制合成,例如从草图生成多样的逼真图片或改变合成语音的情感。我们在广泛基准任务上评估了我们的方法,包括图像到图像、文本到图像、图像描述、文本到语音、语音识别和机器翻译。我们的结果显示在某些任务上达到了最先进(SOTA)性能。
引用
@article{arxiv.1907.04378,
title = {M3D-GAN: Multi-Modal Multi-Domain Translation with Universal Attention},
author = {Shuang Ma and Daniel McDuff and Yale Song},
journal= {arXiv preprint arXiv:1907.04378},
year = {2019}
}