探索音乐驱动舞蹈生成中的多模态控制
声音
2024-03-21 v1 计算机视觉与模式识别
音频与语音处理
摘要
现有的音乐驱动三维舞蹈生成方法主要关注高质量舞蹈生成,但在生成过程中缺乏足够的控制。为了解决这些问题,我们提出了一个统一框架,能够生成高质量的舞蹈动作并支持多模态控制,包括风格控制、语义控制和空间控制。首先,我们将舞蹈生成网络与舞蹈控制网络解耦,从而避免在添加额外控制信息时舞蹈质量下降。其次,我们针对不同的控制信息设计了特定的控制策略,并将其集成到统一框架中。实验结果表明,所提出的舞蹈生成框架在动作质量和可控性方面优于现有最先进方法。
引用
@article{arxiv.2401.01382,
title = {Exploring Multi-Modal Control in Music-Driven Dance Generation},
author = {Ronghui Li and Yuqin Dai and Yachao Zhang and Jun Li and Jian Yang and Jie Guo and Xiu Li},
journal= {arXiv preprint arXiv:2401.01382},
year = {2024}
}