AI 编舞者:基于 AIST++ 的音乐条件化 3D 舞蹈生成
计算机视觉与模式识别
2021-08-03 v3 图形学
多媒体
摘要
我们提出 AIST++,一个包含 3D 舞蹈动作与音乐的新多模态数据集,以及 FACT,一个用于生成以音乐为条件的 3D 舞蹈动作的全注意力跨模态 Transformer(Full-Attention Cross-modal Transformer)网络。所提出的 AIST++ 数据集包含 5.2 小时的 3D 舞蹈动作,分布于 1408 个序列中,涵盖 10 种舞蹈类型,并配有已知相机位姿的多视角视频——据我们所知,这是此类最大的数据集。我们表明,朴素地将序列模型(如 transformer)应用于该数据集以完成音乐条件化 3D 动作生成任务,无法产生与输入音乐良好相关的满意 3D 动作。我们通过在其架构设计与监督上引入关键改动克服了这些缺陷:FACT 模型包含一个带有全注意力的深度跨模态 transformer 模块,经训练以预测 个未来动作。我们经实验表明,这些改动是生成与输入音乐契合良好的长序列逼真舞蹈动作的关键因素。我们在 AIST++ 上通过用户研究进行了大量实验,我们的方法在定性与定量上均优于近期最先进(state-of-the-art)方法。
引用
@article{arxiv.2101.08779,
title = {AI Choreographer: Music Conditioned 3D Dance Generation with AIST++},
author = {Ruilong Li and Shan Yang and David A. Ross and Angjoo Kanazawa},
journal= {arXiv preprint arXiv:2101.08779},
year = {2021}
}
备注
Project page: https://google.github.io/aichoreographer/; Dataset page: https://google.github.io/aistplusplus_dataset/