中文

用于基础舞步生成的弱监督深度循环神经网络

机器学习 2019-06-24 v3 声音 音频与语音处理 机器学习

摘要

合成人体动作(如舞蹈)是一个蓬勃发展的研究领域,在计算机图形学中有若干应用。近期研究已展示深度神经网络(DNNs)在运动和音乐任务中以极少特征预处理工作获得卓越性能的优势。然而,将 DNNs 应用于为音乐生成舞蹈仍具挑战性,因为 1)DNNs 需生成大序列同时映射音乐输入,2)DNN 需将动作节拍约束于音乐,3)DNNs 需要大量手工制作数据。在本研究中,我们提出一种以音频功率谱为输入的弱监督深度循环方法,用于实时基础舞蹈生成。所提模型采用卷积层和多重长短期记忆(LSTM)层处理音频输入。随后,另一深度 LSTM 层解码目标舞蹈序列。值得注意的是,该端到端方法具有 1)自动条件解码配置,减少大舞蹈序列的反馈误差累积,2)使用对比代价函数调节音乐与动作节拍间的映射,3)以动作节拍生成的弱标签训练,减少手工制作数据量。我们基于 i)生成与基线舞者动作间相似性(以大舞蹈序列的交叉熵度量),以及 ii)音乐与动作节拍间准确时序(以 F-measure 度量)评估所提网络。实验结果表明,在使用小数据集训练后,模型生成基础舞步具有低交叉熵并保持与基线舞者相近的 F-measure 分数。

关键词

引用

@article{arxiv.1807.01126,
  title  = {Weakly Supervised Deep Recurrent Neural Networks for Basic Dance Step Generation},
  author = {Nelson Yalta and Shinji Watanabe and Kazuhiro Nakadai and Tetsuya Ogata},
  journal= {arXiv preprint arXiv:1807.01126},
  year   = {2019}
}

备注

8 pages, 7 figures. Proc. IJCNN 2019