协同学习联合生成音频与视频
计算机视觉与模式识别
2021-04-07 v1 人工智能
图形学
多媒体
声音
音频与语音处理
图像与视频处理
摘要
已有许多技术证明了使用 GAN 一次生成一种模态的多媒体数据,例如生成图像、视频和音频的能力。然而,迄今为止,针对音频和视频两者的多模态数据生成任务尚未得到充分探索。为此,我们提出一种方法,证明能够通过音频和视频模态的联合相关生成来生成自然化的视频和音频数据样本。所提方法使用多个判别器来确保音频、视频以及联合输出也与真实世界样本难以区分。我们为该任务提供了一个数据集,并展示我们能够生成真实样本。该方法使用各种标准指标(如 Inception Score、Frechet Inception Distance (FID))以及通过人工评估进行了验证。
引用
@article{arxiv.2104.02656,
title = {Collaborative Learning to Generate Audio-Video Jointly},
author = {Vinod K Kurmi and Vipul Bajaj and Badri N Patro and K S Venkatesh and Vinay P Namboodiri and Preethi Jyothi},
journal= {arXiv preprint arXiv:2104.02656},
year = {2021}
}
备注
ICASSP 2021 (Accepted)