中文

基于最优传输的音乐到舞蹈生成

声音 2022-05-05 v2 计算机视觉与模式识别 机器学习 音频与语音处理

摘要

为一首音乐编舞是一项具有挑战性的任务,既要有创意地呈现独特的风格化舞蹈元素,又要考虑音乐主题与节奏。已有不同方法尝试解决,如相似度检索、序列到序列建模和生成对抗网络(GAN),但它们生成的舞蹈序列往往缺乏运动真实感、多样性与音乐一致性。本文中,我们提出一种基于最优传输网络的音乐到舞蹈生成方法(MDOT-Net),用于学习从音乐生成 3D 舞蹈编舞。我们引入最优传输距离来评估生成舞蹈分布的真实性,以及 Gromov-Wasserstein 距离来衡量舞蹈分布与输入音乐之间的对应关系。这给出了定义良好且非发散的训练目标,缓解了标准 GAN 训练常受不稳定与生成器损失发散问题困扰的局限。大量实验表明,我们的 MDOT-Net 能合成真实且多样的舞蹈,与输入音乐达成有机统一,体现共享意向性并匹配节奏表达。示例结果见 https://www.youtube.com/watch?v=dErfBkrlUO8。

关键词

引用

@article{arxiv.2112.01806,
  title  = {Music-to-Dance Generation with Optimal Transport},
  author = {Shuang Wu and Shijian Lu and Li Cheng},
  journal= {arXiv preprint arXiv:2112.01806},
  year   = {2022}
}

备注

IJCAI 2022