中文

让我们演奏音乐:音频驱动的演奏视频生成

计算机视觉与模式识别 2020-11-06 v1

摘要

我们提出一项新任务,名为音频驱动的演奏视频生成(Audio-driven Performance Video Generation, APVG),旨在根据给定的音乐音频片段合成一个人演奏某种乐器的视频。从低维音频模态生成高维时间一致视频是一项具有挑战性的任务。本文中,我们提出一个多阶段框架来实现这一新任务,从给定音乐生成逼真且同步的演奏视频。首先,我们分别通过生成粗粒度视频以及身体与手的关键点,提供全局外观与局部空间信息。然后,我们提出通过可微空间变换器将生成的关键点转换为热图,因为热图提供更丰富的空间信息但更难直接从音频生成。最后,我们提出结构化时序UNet(Structured Temporal UNet, STU),以分别通过基于图的结构模块和基于CNN-GRU的高层时序模块提取帧内结构信息与帧间时序一致性,用于最终视频生成。综合实验验证了我们所提框架的有效性。

关键词

引用

@article{arxiv.2011.02631,
  title  = {Lets Play Music: Audio-driven Performance Video Generation},
  author = {Hao Zhu and Yi Li and Feixia Zhu and Aihua Zheng and Ran He},
  journal= {arXiv preprint arXiv:2011.02631},
  year   = {2020}
}

备注

ICPR 2020