中文

多乐器演奏者网络:基于身体动作的无监督音乐生成

声音 2020-12-08 v1 计算机视觉与模式识别 音频与语音处理

摘要

我们提出了一种新颖的系统,以音乐家演奏乐器时的身体动作为输入,并在无监督设定下生成音乐。学习从视频中生成多乐器音乐而不标注乐器是一个具有挑战性的问题。为实现该转换,我们构建了一个名为“多乐器演奏者网络”(MI Net)的流水线。其基础是,该流水线使用带有多频带残差块的矢量量化变分自编码器(VQ-VAE)从对数谱图中学习各种乐器音乐的离散潜在表示。随后,该流水线与以循环神经网络编码的音乐家身体关键点动作为条件的自回归先验联合训练。先验与身体动作编码器的联合训练成功将音乐解耦为指示音乐成分和乐器特征的潜在特征。潜在空间产生聚类为不同乐器的分布,从中可生成新音乐。此外,VQ-VAE 架构支持通过额外条件进行精细音乐生成。我们展示 Midi 可进一步约束潜在空间,使得流水线生成视频中乐器所演奏音乐的精确内容。我们在包含两个数据集(含13种乐器视频)上评估 MI Net,获得了具有合理音频质量、易与相应乐器关联且与音乐音频内容一致的生成音乐。

关键词

引用

@article{arxiv.2012.03478,
  title  = {Multi-Instrumentalist Net: Unsupervised Generation of Music from Body Movements},
  author = {Kun Su and Xiulong Liu and Eli Shlizerman},
  journal= {arXiv preprint arXiv:2012.03478},
  year   = {2020}
}

备注

Please see associated video at https://www.youtube.com/watch?v=yo5OZKBbBh4