中文

面向游戏内专家级音乐到舞蹈翻译的半监督学习

计算机视觉与模式识别 2020-09-29 v1 多媒体

摘要

音乐到舞蹈的翻译是近期角色扮演游戏中一个全新且强大的功能。玩家现在可以让其角色随指定音乐片段起舞,甚至生成粉丝自制的舞蹈视频。此前该主题的工作将音乐到舞蹈视为基于时间序列数据的监督式运动生成问题。然而,这些方法受限于有限的训练数据对以及动作的退化。本文为该任务提供了一个新视角,我们将翻译问题重新表述为基于编舞理论的分段舞蹈短语检索问题。借助这样的设计,玩家可以在我们生成的基础上进一步编辑舞蹈动作,而其他基于回归的方法忽视了这种用户交互性。考虑到舞蹈动作捕捉是一项昂贵且耗时的过程,需要专业舞者的协助,我们在半监督学习框架下训练我们的方法,并收集了规模达标注数据 20 倍的大型无标签数据集。我们引入了一种协同上升机制以提升网络的鲁棒性。利用该无标签数据集,我们还引入了自监督预训练,使翻译器能够理解音乐短语的旋律、节奏及其他组成部分。我们表明,与从头训练相比,预训练显著提升了翻译准确率。实验结果表明,我们的方法不仅对各种风格的音乐具有良好泛化性,还成功实现了面向游戏玩家的专家级编舞。

关键词

引用

@article{arxiv.2009.12763,
  title  = {Semi-Supervised Learning for In-Game Expert-Level Music-to-Dance Translation},
  author = {Yinglin Duan and Tianyang Shi and Zhengxia Zou and Jia Qin and Yifei Zhao and Yi Yuan and Jie Hou and Xiang Wen and Changjie Fan},
  journal= {arXiv preprint arXiv:2009.12763},
  year   = {2020}
}

备注

14 pages, 8 figures