时间引导的音乐到身体运动生成
多媒体
2020-09-18 v1 人工智能
声音
音频与语音处理
图像与视频处理
摘要
本文提出了一种神经网络模型,用于从音乐音频生成虚拟小提琴家的三维骨架运动。以往工作使用传统循环神经网络模型生成二维骨架数据,本文模型在其基础上进行了改进,引入了编码器-解码器架构以及自注意力机制,以对身体运动序列中的复杂动态进行建模。为便于优化自注意力模型,本文应用节拍追踪来确定训练样本的有效大小与边界。解码器配有精炼网络与运弓起奏推断机制,以强调右手行为与运弓起奏时机。客观与主观评估均表明,本文提出的模型优于现有方法。据我们所知,本工作是首次尝试在考虑音乐身体运动关键特征的情况下生成三维小提琴家身体运动。
引用
@article{arxiv.2009.08015,
title = {Temporally Guided Music-to-Body-Movement Generation},
author = {Hsuan-Kai Kao and Li Su},
journal= {arXiv preprint arXiv:2009.08015},
year = {2020}
}