用于从舞蹈视频生成复杂音乐的量化GAN
计算机视觉与模式识别
2022-07-20 v2 声音
音频与语音处理
摘要
我们提出Dance2Music-GAN(D2M-GAN),一种新颖的对抗式多模态框架,可基于舞蹈视频生成复杂的音乐样本。我们提出的框架以舞蹈视频帧与人体动作为输入,并学习生成合理伴随相应输入的音乐样本。与大多数现有的条件音乐生成工作(使用符号音频表示(例如MIDI)生成特定类型的单乐器声音,且通常依赖预定义音乐合成器)不同,本工作中我们通过采用向量量化(VQ)音频表示来生成复杂风格(例如流行、霹雳舞等)的舞蹈音乐,并利用其符号与连续对应物的通用性与高抽象能力。通过在多个数据集上进行广泛的实验,并遵循全面的评估协议,我们针对替代方案评估了我们提案的生成质量。所获取的衡量音乐一致性、节拍对应与音乐多样性的定量结果,证明了我们所提方法的有效性。最后但同样重要的是,我们策划了一个具有挑战性的野外TikTok视频舞蹈-音乐数据集,用于进一步展示我们的方法在真实世界应用中的功效——并希望其能作为相关未来研究的起点。
引用
@article{arxiv.2204.00604,
title = {Quantized GAN for Complex Music Generation from Dance Videos},
author = {Ye Zhu and Kyle Olszewski and Yu Wu and Panos Achlioptas and Menglei Chai and Yan Yan and Sergey Tulyakov},
journal= {arXiv preprint arXiv:2204.00604},
year = {2022}
}
备注
Dataset and code at https://github.com/L-YeZhu/D2M-GAN