中文

CMCGAN:一种跨模态视觉-音频相互生成的统一框架

计算机视觉与模式识别 2017-12-12 v2

摘要

视觉与音频模态是视频底层的两个共生模态,它们既包含共性信息也包含互补信息。若能充分挖掘并融合这些信息,相关视频任务的性能将得到显著提升。然而,由于环境干扰或传感器故障,有时仅存在一种模态,而另一种模态被丢弃或缺失。通过基于两者共享的共性信息与特定模态的先验信息,从现有模态恢复缺失模态,将为各类视觉任务带来巨大收益。本文提出一种跨模态循环生成对抗网络(CMCGAN)来处理跨模态视觉-音频相互生成。具体而言,CMCGAN由四类子网络组成:音频到视觉、视觉到音频、音频到音频和视觉到视觉子网络,它们以循环架构组织。CMCGAN具有若干显著优势。首先,CMCGAN通过联合对应对抗损失将视觉-音频相互生成统一到一个通用框架中。其次,通过引入具有高斯分布的潜向量,CMCGAN能够有效处理视觉与音频模态在维度和结构上的不对称。第三,CMCGAN可端到端训练,更加便捷。得益于CMCGAN,我们开发了一种动态多模态分类网络来处理模态缺失问题。大量实验表明,CMCGAN取得了最先进的跨模态视觉-音频生成结果。此外,生成模态达到了与原始模态相当的效果,证明了我们所提方法的有效性与优势。

关键词

引用

@article{arxiv.1711.08102,
  title  = {CMCGAN: A Uniform Framework for Cross-Modal Visual-Audio Mutual Generation},
  author = {Wangli Hao and Zhaoxiang Zhang and He Guan},
  journal= {arXiv preprint arXiv:1711.08102},
  year   = {2017}
}

备注

Have some problems need to be handled