Transflower:基于多模态注意力的概率自回归舞蹈生成
声音
2022-06-14 v3 图形学
机器学习
音频与语音处理
摘要
舞蹈需要依据音乐的节奏、音高与音色特征巧妙编排复杂动作。形式上,以一段音乐为条件生成舞蹈可表述为以音频信号为条件的建模高维连续运动信号的问题。本文为此作出两点贡献。第一,我们提出一种新颖的概率自回归架构,利用多模态transformer编码器,以先前姿态与音乐上下文为条件,通过归一化流建模未来姿态的分布。第二,我们引入当前最大的3D舞蹈动作数据集,其通过多种动作捕捉技术获取,包含专业与业余舞者。使用该数据集,我们通过客观指标与用户研究将新模型与两个基线比较,表明建模概率分布的能力以及能关注大范围运动与音乐上下文,是生成契合音乐、有趣、多样且逼真舞蹈所必需的。
引用
@article{arxiv.2106.13871,
title = {Transflower: probabilistic autoregressive dance generation with multimodal attention},
author = {Guillermo Valle-Pérez and Gustav Eje Henter and Jonas Beskow and André Holzapfel and Pierre-Yves Oudeyer and Simon Alexanderson},
journal= {arXiv preprint arXiv:2106.13871},
year = {2022}
}
备注
Article presented at SIGGRAPH Asia 2021, and published in ACM Transactions on Graphics