FoleyGAN:基于视觉引导生成对抗网络的静音视频同步声音生成
机器学习
2021-07-21 v1 人工智能
计算机视觉与模式识别
多媒体
声音
摘要
基于深度学习的视觉到声音生成系统本质上需要特别考虑视觉与音频特征随时间同步的方面进行开发。在本研究中,我们引入了一项新任务:用视频输入的时间视觉信息引导类别条件生成对抗网络,以完成视觉到声音生成任务,并适配视听模态间的同步特性。我们提出的 FoleyGAN 模型能够 conditioning 视觉事件的动作序列,从而生成视觉对齐的真实音轨。我们扩展了先前提出的 Automatic Foley 数据集以用 FoleyGAN 训练,并通过人类调查评估我们合成的声音,结果显示出值得注意的(平均 81%)视听同步性能。与其他基线模型和视听数据集相比,我们的方法在统计实验中也表现更优。
引用
@article{arxiv.2107.09262,
title = {FoleyGAN: Visually Guided Generative Adversarial Network-Based Synchronous Sound Generation in Silent Videos},
author = {Sanchita Ghose and John J. Prevost},
journal= {arXiv preprint arXiv:2107.09262},
year = {2021}
}
备注
This article is under review in IEEE Transaction on Multimedia. It contains total 12 pages, 6 figures, 4 tables