MIDGET:音乐条件3D舞蹈生成
声音
2024-04-19 v1 计算机视觉与模式识别
图形学
音频与语音处理
摘要
本文提出一种MusIc条件3D舞蹈生成模型,命名为MIDGET,基于Dance motion Vector Quantised Variational AutoEncoder(VQ-VAE)模型和Motion Generative Pre-Training(GPT)模型,生成与音乐节奏匹配且质量高的舞蹈动作。为解决该领域的挑战,我们引入了三个新组件:1)基于Motion VQ-VAE模型的预训练记忆码本,用于存储不同的人体姿态码;2)采用Motion GPT模型生成带有音乐和运动编码器输入的姿态码;3)一个简易的音乐特征提取框架。我们与现有最先进模型进行比较,并在AIST++上进行消融实验,该数据集是公开最大的音乐-舞蹈数据集。实验结果表明,我们提出的框架在运动质量及其与音乐的对齐方面实现了最先进的性能。
引用
@article{arxiv.2404.12062,
title = {MIDGET: Music Conditioned 3D Dance Generation},
author = {Jinwu Wang and Wei Mao and Miaomiao Liu},
journal= {arXiv preprint arXiv:2404.12062},
year = {2024}
}
备注
12 pages, 6 figures Published in AI 2023: Advances in Artificial Intelligence