Sound2Sight:从声音与上下文生成视觉动态
计算机视觉与模式识别
2020-07-24 v1 机器学习
声音
音频与语音处理
摘要
跨模态学习关联对于鲁棒的多模态推理至关重要,尤其在推理时某一模态可能缺失的情况下。本文在音频条件视觉合成的背景下研究该问题——此任务在遮挡推理等场景中十分重要。具体而言,我们的目标是以音频和少量过往帧为条件生成未来视频帧及其运动动态。为应对该问题,我们提出 Sound2Sight,一种深度变分框架,经训练以学习以音频与过往帧联合嵌入为条件的逐帧随机先验。该嵌入通过基于多头注意力的音视觉 transformer 编码器学习。所得先验随后被采样以进一步条件化视频预测模块来生成未来帧。随机先验使模型能采样与所给音频及过往上下文一致的多个合理未来。此外,为提升生成帧的质量与连贯性,我们提出一种区分合成与真实音视觉片段的多模态判别器。我们在两个新数据集即(i)带突发障碍的多模态随机移动 MNIST,(ii)Youtube 画作;以及现有 Audio-Set Drums 数据集上,针对紧密相关的已有方法对我们的方法进行了实证评估。大量实验表明,Sound2Sight 在生成视频质量上显著优于当前最优方法,同时生成多样的视频内容。
引用
@article{arxiv.2007.12130,
title = {Sound2Sight: Generating Visual Dynamics from Sound and Context},
author = {Anoop Cherian and Moitreya Chatterjee and Narendra Ahuja},
journal= {arXiv preprint arXiv:2007.12130},
year = {2020}
}
备注
Accepted at ECCV 2020