中文

深度跨模态视听生成

计算机视觉与模式识别 2017-04-28 v1 多媒体 声音

摘要

跨模态视听感知在心理学和神经学中是长期存在的课题,多项研究发现了人类听觉与视觉刺激感知之间的强相关性。尽管有计算多模态建模的工作,跨模态视听生成问题在文献中尚未被系统研究。本文首次尝试利用深度生成对抗训练解决这一跨模态生成问题。具体而言,我们使用条件生成对抗网络实现音乐演奏的跨模态视听生成。我们探索了音频和视觉信号的不同编码方法,并致力于两种场景:面向乐器的生成和面向姿态的生成。作为探索这一新问题的首作,我们构建了两个新数据集,包含不同乐器音乐演奏的图像与声音对。我们使用分类和人工评估的实验表明,我们的模型在一定程度上能够从一个模态(即视觉/音频)生成另一模态(即音频/视觉)。我们在各种设计选择及数据集上的实验将促进这一新问题领域的未来研究。

关键词

引用

@article{arxiv.1704.08292,
  title  = {Deep Cross-Modal Audio-Visual Generation},
  author = {Lele Chen and Sudhanshu Srivastava and Zhiyao Duan and Chenliang Xu},
  journal= {arXiv preprint arXiv:1704.08292},
  year   = {2017}
}